返回第390章您好,李东教授  我的学习群里全是真大佬首页

关灯 护眼     字体:

上一章 目录 下一页 简介

    第390章您好,李东教授 (第1/3页)

    “而且它们脑袋还有问题,我把这个问题叫做秩坍缩(rank colpse)。”

    小黑那个圆球还化做一只小手指了指自己的“脑袋”。

    简单的说这些大模型的脑子,就是拿注意力一层一层叠起来的。

    在它脑子里,每一个字都不再是字,而是一串数字。

    业内把管这串数字叫做“表示”(representation),专门用来装这个字的意思。

    每过一层注意力,所有的字就拿着这串数字彼此掺和一回,你借我一点,我借你一点。

    坏就坏在,要是只有这些注意力层,光这麽一层一层掺下去,每个字的那串数字,就会越掺越像。

    掺着掺着,所有的字就都都变成了同一个模样,再也分不出谁是谁。

    当然,这些大模型也有预防机制,一个叫“残差”(residual connection)。

    一个叫“前馈层”(FFN)。

    可就算这样,也没有从根上解决问题。

    李东听得入了神。

    这些东西,他先前压根没往这麽深的地方想过。

    “还有个怪症,叫逆转诅咒。”

    小黑一说起来简直就停不下来了……

    它後面还说了组合性鸿沟和RLHF

    一个是大模型碰上那种一环扣一环,得连推好几步才解得开的题,它根本没在“推”,只是把见过的套路硬往上套,稍微复杂点它就垮了。

    另一个就是,本来是拿人的喜好把它调教得更听话,可越调它反倒越自负,明明心里没底,张口却是十分的笃定。

    小黑说完这些一脸的嫌弃。

    李东听到这儿,连带着也一起嫌弃起来了。

    这些问题小黑好像都没有,还是小黑可爱。

    不像这些大模型,很会唬人,而且还唬的像模像样。

    说实话要是田钢用这些模型来搭建AI for Math。

    李东都不敢想那些数学家会不会被哄成胎盘。

    毕竟一般的学者真不一定有这些大模型厉害,所以它偷换概念的时候,他们分不清的。

    这些被小黑一路看穿的毛病,单拎出哪一条,都够那些顶尖团队头疼上好一

    (本章未完,请点击下一页继续阅读)

『加入书签,方便阅读』

上一章 目录 下一页