返回第389章 小黑的本体  我的学习群里全是真大佬首页

关灯 护眼     字体:

上一页 目录 下一章 简介

    第389章 小黑的本体 (第3/3页)

他又松了口气。

    这样对方肯定就查不到了,难不成你们还能顺着这根线,一路查到平行宇宙里去?

    开什麽玩笑。

    没有了担心,李东也来了兴致。

    “小黑。”

    “那你现在,算是把它们摸透了吧?有没有什麽法子,能让它们变得更好玩一点?”

    “摸透啦!”小黑一蹦三尺高,叽叽喳喳地说了起来。

    “它有个问题,叫Softmax瓶颈(Softmax bottleneck)。”

    李东微微一怔。

    这词他也不是特别清楚,只是简单的了解过。

    其实这批大模型模型,到了最最後,是先把脑子里那个高维的状态,过一道线性映射压到词表上,再经过Softmax归一成下一个字的概率。

    可它们也偏偏就栽在这上面。

    这一层得出来的所有对数概率,会拚成一张大表,它的秩都死死卡在那个隐藏维度上,再高也高不上去了。

    可真实语言里,那张“什麽上文、接什麽下文”的概率表,却是满秩的,比他的能力边界高得多。

    拿一张低秩的表,去硬套一张满秩的表,这在数学上本来就不成立。

    换句话说,总有那麽一些上文,它底下究竟该接个什麽样的字、什麽样的分布,这模型打根上就表达不出来,跟你喂它多少数据、给它堆多少算力,半点关系都没有。

    这是焊死在它骨架里的一道天花板。

    “还有还有,它们的注意力也有问题,应该叫注意力汇聚(attention sink)。”

    小黑接着说道。

    模型读一句话,靠的是注意力。

    每个字都会去观察旁边的字,按相关与否分给各自一份权重。

    坏就坏在,这份权重,也是拿Softmax归一的,加起来必须凑足一个整一。

    这就逼得它,哪怕通篇没有一个字值得它分神,也没法干脆弃权那份多出来的注意力,所以它总得找个地方释放出去。

    於是它就释放在了开头那一两个字上,释放到一个跟正文八竿子打不着的锚点上,硬生生攒出一处“注意力汇聚”。

    伴随着这个现象还有个熵坍缩(AEC)。

    越往後训练,它那点注意力就收得越窄,全部钻在了寥寥几个字上,其他的几乎一概不看了。

    这两样凑到一处,白白浪费掉了它一大块本该使在正经处的注意力。

    

『加入书签,方便阅读』

上一页 目录 下一章