2026-08-20
AI领域的转折:强化学习的先驱对现状的严峻评估
近日,强化学习的开创者理查德·萨顿(Rich Sutton)和他的学生胡拉姆·贾韦德(Khurram Javed)在与红杉资本的播客交流中,表达了对当前人工智能发展方向的重大质疑。他们二人刚刚共同创办了Oak Lab,旨在从根本上改变现有大型模型的主流策略。现阶段AI圈内热衷于增大模型规模以及在数据不足时利用算法生成所谓的“合成数据”。然而,萨顿对此强烈反对,认为合成数据是一种极大的误导,因为现实世界的复杂性无法被任何人类构建的模拟器完全包罗。同时,他指出,目前流行的大型语言模型在上线后就停止了学习,模型的权重固定不变,“这仅仅是智能的四分之一”。在经历过AI寒冬并战胜癌症的老学者毫不犹豫地表达了他的观点:“我没疯,是这个领域疯了。”
在这次讨论中,萨顿和贾韦德不仅剖析了为何一些顶尖实验室被困于各自的小范围优解中难以调整方向,同时也提出了他们的终极解决方案,即摒弃现有的静态训练方式,解决灾难性遗忘的问题,计划在五到十年内开发出一种能像真实生物一样持续学习与进化的系统,并且功耗仅为20瓦特。
核心观点方面,他们强调,监督学习并不是自然界中动物学习的本质。虽然学校是获取知识的一种方式,但这并不代表智能的本质。人类在数百年前并没有现代学校的教育体系,我们的生存智慧根本不依赖于这种学习方式。关于大型模型的学习能力,萨顿提到,预训练和后训练只是在模型上线前的过程,模型一旦上线便不再学习,若有人声称能创造一个博士级能力但后续不再学习的系统,那才是令人惊讶的。在谈到合成数据时,他再次重申其缺陷:合成数据无法完美反映现实的复杂性,尤其是在如无人机电机磨损等问题上,真实的经验和数据才是关键。
他指出,为何大型实验室无法转向新的理论框架:因为他们被固有的商业环节束缚住了,害怕在迈向新范式时会经历性能上的暂时下降,因此不敢冒险。而关于语言模型的未来,萨顿认为虽然它们是一项惊人的突破,但不能忽视的是,语言仅占智能的四分之一,AI的探索之路仍在继续。
此访谈中,萨顿还回顾了他多年前坚信投入强化学习研究的原因。他提到,在AI寒冬时期,他的病痛让他对生活和工作有了新的思考,最终选择在阿尔伯塔大学投身教育和研究。萨顿的坚持与追求反映了他对心智和学习本质的深刻理解,同时也启发着新一代的AI研究者。