返回第402章 路就在眼前,你们修不修吧。  我的学习群里全是真大佬首页

关灯 护眼     字体:

上一页 目录 下一页 简介

    第402章 路就在眼前,你们修不修吧。 (第2/3页)

的收敛半径、泛化误差上界、离散网格的采样密度。

    没一句是干货。

    李东听了几分钟,大概就明白这到底是怎么回事了。

    这三家,平日里你抢我的人我挖你的墙角。

    谁家的预训练在哪儿卡了壳,那都是压箱底的机密,当着两家死对头的面,谁会真的掏底呀?

    按照这个聊法,聊到大会闭幕,也聊不进正题。

    于是李东放下茶杯,笑眯眯地打断了雅各布。

    “雅各布博士,你问的这些,你们组自己挂出来的技术报告里,就有答案。”

    “咱们立个规矩吧。”李东笑着看向了休息室里的众人,“今天在这间屋子里,不管谁提的问题,我的回答,三家一起听。”

    “所以……藏着掖着的最吃亏。”

    三位首席科学家面面相觑。

    几秒钟后,也不知道是谁先把心一横。

    反正答案大家都听得见,那还客气什么?

    多问的,才是赚的。

    “李东教授。”

    还是雅各布先开口。

    “那我换个问法。”

    “千亿级参数的loss曲面,强上全量hessian矩阵纯属做梦,二阶的预条件子连显存都塞不进,只能退化到一阶的adam系硬磨。”

    “如果先用您那套算法重排,把参数空间正交化到近似对角阵……”

    “预条件子,是不是就能直接降维成逐元素的标量缩放?”

    他一说完,另外两家的人也停下了手中正在记录的笔,抬头看向李东。

    李东听完点了点头。

    “路子是对的。”

    “但你们光盯着算力和显存了,问题的核心不在于算不算得起。”

    “而在于你们根本不知道,该在哪个标度上去算。”

    雅各布一怔:“标度?”

    “loss曲率不是一张静态的地图。”

    李东说道。

    “它跟着你的batch size缩,跟着学习率漂,还跟着网络的width一起扭曲。”

    “我那个算法之所以成立,是因为zeta算子的谱特征背后,有一套解析的scaling law兜底。”

    “我是先吃透了规律,才敢去动算的。”

    “而你们呢?”

    “你们梯度的噪声标度,是怎么做标定和对齐的?”

    “网络width翻一倍这个scale往哪边漂移,你们跑过消融实验吗?”

    雅各布握张了张嘴没出声,整个人像是被这一问,好像让他想到了什么。

    与此同时,李东的记忆宫殿里。

    大厅中央那座临时书架上,现出了一份崭新的残篇。

    【临界batch size,由梯度噪声的scale唯一确定。 】

    【将学习率、批大小、网络宽度与深度,统一收敛至同一套scaling law解析式。 】

    【在千万级参数的proxy模型上定死全局超参,借参数化的对称性,零样本无损迁移至万亿参数域。 】

    【若该定律成立,不同参数规模的loss下降曲线,在对数坐标系下必将塌缩为同一条母线。 】

    【至于attention机制内的softmax温度超参,如何随宽度协同缩放……】

    李东看着这个残片,心里已经服气了。

    在小模型上把戏排完,到大模型上直接zero-shot首演,连彩排的场租都省了。

    这帮人藏在肚子里的东西,可比他们挂在网上的论文,值钱太多了,这就是经验,或者说这特么就是用钱烧出来的灵感。

    他李东或许花点时间也能想出来,但是想出来有什么用?

    他有钱去烧,然后去验证自己的想法吗?

    而现在雅各布的经验明显替他省掉了这笔钱。

    现实里,雅各布回过神来,几乎是立马将灵感写进了本子里。

    有了他开这个头,休息室里也就破冰了。

    接下来的交流就脱离了常规的一问一

    (本章未完,请点击下一页继续阅读)

『加入书签,方便阅读』

上一页 目录 下一页