Spots

Chris Manning: Language Is the Real Unlock for Intelligence | Chris…

这是斯坦福NLP大牛Chris Manning的播客访谈,聊大模型、语言学、AI怎么学习、不同AI架构之争,我用大白话把核心内容讲明白。

现在做大模型的人,很多是搞物理、数学出身,感觉好像不需要懂语言学也能把大模型做出来。 但Manning说:不是这样。…

现在做大模型的人,很多是搞物理、数学出身,感觉好像不需要懂语言学也能把大模型做出来。 但Manning说:不是这样。 像组合理解、举一反三泛化能力这些现在AI圈天天念叨的能力,源头其实是语言学、语言哲学,不是搞数学推导出来的。 简单说:语言学很多想法藏在大模型背后,只是很多做AI的人没意识到。 早些年研究自然语言处理的人,既要懂编程,也要懂各种人类语言。 现在很多人是学机器学习,转头就拿大模型处理语言问题,本身不懂语言学。 学界开会已经有人警告:NLP别最后变成纯粹调机器学习模型,把研究“语言”这件事给丢了。 但真正语言学研究没有消失,只是跑到小众专题研讨会上,比如研究少数民族语言、古老语言。 但真正语言学研究没有消失,只是跑到小众专题研讨会上,比如研究少数民族语言、古老语言。 主持人感慨:我原本以为,计算语言学家会拿来破解那些没人能读懂的古代文字,结果行业里几乎没人干这个。 以前读博士做机器翻译,要求你自己从零写代码,搭建翻译系统。 现在你个人写的程序,怎么都打不过现成大模型。 博士生能干的活只剩下:拿数据微调大模型、测试大模型好坏。很难再自己造一套核心系统。 而且有意思:语言学家本身,几乎不受大模型影响。语言学家还在研究句子结构、词义,仿佛大模型跟他们没关系,Manning觉得这其实不太好。 ✅ 未来语言学+AI该研究什么? 过去AI主攻简单底层任务:分词、识别人名、解析句子语法。现在大模型这些基础活干得很不错。 以后重点要往上走: 现在大模型聊天有个大毛病:不懂“谦虚”。明明自己不知道,说得斩钉截铁。人类说话没把握的时候会说“可能、大概”,大模型不会,这块是很大的空白。 世界语就是人造语言,简单好学。 现在AI互相聊天,会发展出一套人类看不懂的“AI黑话”,人看不懂AI心里的思考过程。 主持人提问:我们设计人造语言,用来让AI沟通,方便人类审查行不行? 人造语言很难大规模用。AI极度依赖海量数据,中文、英文数据最多,永远是主角。

但是!AI自己冒出来的奇怪沟通方式,恰恰是语言学家该去研究的对象。就像人类研究不同方言黑话一样,拿语言学工具分析AI之间到底在传递什么信息。…

但是!AI自己冒出来的奇怪沟通方式,恰恰是语言学家该去研究的对象。就像人类研究不同方言黑话一样,拿语言学工具分析AI之间到底在传递什么信息。 5、重点实验:大模型学语言,是先记例子,还是先总结类别? 观点A(先抽象分类):孩子先脑子里建立分类,比如“给东西的动词”“移动的动词”,之后遇到新动词直接放进分类。 观点B(先死记例子):小孩先死记“give给、go走”一个个单词的用法,看多了例子,才慢慢总结出类别。 Manning拿小版GPT‑2做实验: 结果发现:AI刚学出一点规律的时候,就已经自动分出类别了。 哪怕某个类别里面大部分词很少见,AI也能形成大类。不是先死记单个高频词。 👉为什么会这样? 大模型每个词都变成一串数字向量,相似的词数字很接近。学一点点东西,会直接影响所有其他词语。训练早期所有词向量挤在一起,学到一个词的特点会传染给别的词。训练久了各个词向量拉开距离,才慢慢分开。 提醒:这个实验只用了小模型。超大模型是不是一模一样还不好说,但理论推测大概率类似。 提醒:这个实验只用了小模型。超大模型是不是一模一样还不好说,但理论推测大概率类似。 杨立昆(LeCun)的看法: 人真正的思考不靠语言,靠脑子里图像想象;语言只是人与人传话工具。纯文本大模型有天生缺陷,必须要让AI看懂物理世界、看懂图像,要用JEPA新架构,不能靠自回归大语言模型。 Manning不同意这个看法: 人和猩猩大脑硬件差别不大,但人类远远更聪明,语言才是人类智力的关键钥匙 个人角度:我们很多思考,就是脑子里内心独白,用语言思考;语言是人类第一个强大思考工具,后来才有数学、编程。 集体角度:人类厉害是因为集体智慧。造一台iPhone没有任何一个人懂全部技术,靠千百人语言沟通分工。现在多个AI智能体互相交流合作,也出现这种集体智慧。 不是说JEPA完全不行,Manning认为杨立昆太低估语言本身对思考的作用。 以前有个著名论文观点:只看文字的AI永远不会懂真正意思。就好比章鱼没有见过外面世界,光看书理解不了世界。必须要“文字+现实画面配对学习”。 Manning的立场:

只看文字,AI*是可以学懂一部分现实世界规律*。 证据:只用看游戏操作记录,AI内部自己会生成游戏棋盘的虚拟模型,用来预测下一步。同理,只读文字大模型内部会冒出…

只看文字,AI*是可以学懂一部分现实世界规律*。 证据:只用看游戏操作记录,AI内部自己会生成游戏棋盘的虚拟模型,用来预测下一步。同理,只读文字大模型内部会冒出对物理世界的认知。 但是!只靠文本效率很低。 所以现在做多模态(文字+图片视频)非常有价值,可以学得更快更好,但不是“没有图像就绝对不可能懂世界”。 8、扩散模型能不能干掉Transformer大语言模型? 图像生成用的扩散模型效果很好,生成图片花样更多。大家就想:能不能用扩散模型做文字,替代现在大模型? Transformer优势:做逻辑推理、关系理解很强。扩散模型能不能做到同等推理还不确定。 两边技术在互相靠近:扩散一次生成一大段文字;现在Transformer也在搞推测解码,一次性输出一大段。 希望看到更多不一样架构出来竞争。 9、RAFT:改AI的“临时想法”,而不是修改AI本身权重(对比LoRA) 现在常用LoRA微调:给大模型增加一点点新参数,来改变模型行为。 RAFT思路不一样:大模型本体完全不动,不去改模型权重参数,只修改中间瞬间输出的激活状态(临时表征)。 效果可以接近LoRA。 绝大部分事实知识,牢牢存在模型权重(AI本体)里面; 但知识怎么调用、输出什么回答,由中间表征(临时状态)决定。 类比: 权重=一本装满全部知识的百科全书; 表征=你这一瞬间翻到哪一页,怎么解读这本书。 工程好处:大模型本体冻结不变,不同用户只改临时状态,服务器可以高效服务成千上万客户。 还有一个学界热点猜想:一个概念对应向量空间一条直线。 Manning说:大家喜欢这个假设,只是因为好做实验。真实AI里面编码很复杂,存在很多非线性叠加,不全是简单直线。 总结最核心一句话: 语言不只是用来沟通,语言本身就是实现高级智能的核心钥匙。不能简单认为光看文字就一定产生不了理解,但是结合图像视频会做得更好;语言学的思想,依旧对AI未来非常重要。 如果你需要,我还可以把其中某一个话题再压缩讲的更短。 For further actions, you may consider blocking this person and/or

reporting abuse

reporting abuse

News

Chris Manning: Language Is the Real Unlock for Intelligence | Chris Manning播客——语言才是解锁智能的关键

这是斯坦福NLP大牛Chris Manning的播客访谈,聊大模型、语言学、AI怎么学习、不同AI架构之争,我用大白话把核心内容讲明白。

@spots #dev
Source: Dev.to
See more like this