随着AI工具的发展,AI(大语言模型)会越来越工具化。

从预训练到强化学习训练

你有没有想过,为什么AI大语言模型的越来越不说人话了?像Claude经常被人吐槽英文看不懂,中文也看不懂。 也有没有想过之前AI在生图,生歌上突飞猛进,但是为什么现在突然转向了数学,编程,机器等领域?

这都是源于大语言模型的训练方式的改变。强化学习(RL)在大规模的引用到了大语言模型之中。

可以看到,大语言模型中后训练的算力已经超过前训练了?前训练指的是用互联网搜集的人类预料,人类的代码 来训练一个大语言模型,这时候这个大语言模型只会模仿人类的语言,预测下一个字。

后训练指的是大语言模型在完成前训练之后,通过一些特殊的数据让这个语言模型学会对话,增强写代码,不输出 色情内容等等。在2023-2024年左右大家都是这样训练了,像是GPT4这类的模型。这类模型有一些特点,就是非常的像人, 输出的内容有“人味”,还有不少人用这些大语言模型做NPC,玩酒馆这种人机对话模型。这个阶段后训练是不需要太多资源的。

那什么时候变化了呢?Claude的出现。

最开始的时候OAI是没有专注于编程的,他们更想变成一个全能的问答引擎,代替Google。或者变成一个大家的流量入口, 当初OAI推出了一个叫做GPTS的工具。

这个工具展现了OAI当时代替苹果和谷歌,作为一个应用商店取得流量入口的野心。但是现在已经没有人在用了。

之后OAI也推出了Tiktok的竞品Sora,也在几个月之后就关闭了。

可以总结为在2023-2025之间,OAI一直尝试商业化大模型,但是几乎所有TO C的尝试都失败了。而在这期间,Claude却在 编程这个领域高歌猛进。结果到了2025年底OAI折腾了一大圈发现,Claude才是那个真正抓住AI商业化机遇的人,一年时间 从不到一亿的营收迅速涨到了上百亿的营收。所以OAI以及绝大部分模型厂商,都在开始专注编程这个赛道了。

想要做好编程,那就需要大量的编程数据,这些厂商会抓取大量的开源软件的数据,放到后训练中,这个阶段能看到很多 除了Github的开源软件托管平台抱怨说这些AI厂商以近乎DDOS的方式抓取数据。

但是这样还是不够,人类的数据很快就消耗完了,模型厂商只能自己生成数据了。你看到很多人开始吹RSI(自我进化的AI)。 RSI的一个特点是模型可以自我生成数据,提升自己的性能。其实在AI领域,这个叫做强化学习"Reinforcement Learning"。

比如围棋AI,你可能会听说一个叫做AlphaGo的模型,最开始这个模型是模仿人类围棋的下法做出来的。然而人类下棋的数据不够了, Google后来推出了一个模型叫做AlphaZero,这个模型就是不依赖人类模型,靠机器自我对奕生成数据,一步步的提升。 如果说有RSI,那AlphaZero就是最先的RSI,只不过当时没有那个叫法而已。

数据不够了怎么办?我们有各种各样的题目,比如算法题,比如各种模型的benchmark,比如人开发代码时候的工单。这些数据互联网上 很多,然后让AI在一个环境中尝试解决这个问题,跑通了给奖励,跑错了给惩罚,这样模型会一点点的找到解决问题的方法。

比如最近小米就把他们后训练的过程展示给大家了,可以看到其中编程方面的benchmark一直在上涨,这里小米没有给AI提供新的数据 而是直接利用刚才那个RL的过程,让模型自我提升的。

AI的工具化

那这个和AI的工具化有什么关系?这个RL过程中最重要的是回报函数,也就是说需要一个函数能判断这个执行过程是不是正确的。 编程中很好判断,比如一个程序能不能成功执行,是很好判断的。一个程序输出的结果是否满足要求,也可以通过写test判断。

数学也是一样,数学的逻辑推理很严谨,甚至可以用lean的方式来确认一个证明是不是正确的。在编程相关的benchmark逐渐饱和的 现在,OAI投入巨量的算力主攻数学,这也是我们最近看到的一系列的数学突破的由来。

但是这个奖励函数是十分机械的,不可能照顾解决问题中间方方面面的知识,也不可能让AI有人一样的限制。举个例子来说,OAI之前也 用强化学习让人打Dota,结果AI学出来的是用他们几乎为0的反应时间和极为准确的操作为基础的一套战术。AI不是像开挂那样一点技术 都没有,但是很多战术都是基于AI能够极快的反应对手的威胁,并且这个威胁的信息能够快速的共享给AI。

用王者比喻就是在一条路上面,对手放了个闪现,那几乎所有AI都知道大招已经进入CD了,而且大招CD的计时是以毫秒记的。

AI编程也是一样,经常能看到AI写了一堆脚本,来帮助自己编辑某个文件,因为自身LLM的输出不够稳定。随着RL训练的越来越多, Agent就更倾向于使用程序化的工具,而不是像普通人一样用文本编辑器。

在工作上,我越用AI,这种非人的感觉就越强烈。无论是看AI生成的文本,还是看AI调用工具的痕迹,都很明显的感受到了AI不是一个 类似人的生命体,而是某种机械性的程序。越后期的模型这种强化学习的味道就越强烈,非常像一个机器,很多策略都是因为机器 能够精准的操作电脑才能达成的,就像之前说的用脚本编辑文件一样。

而且,AI企业现在严重依赖TO B的收入,也会让AI企业越来越把他们的大模型工具化。企业要求不像大众一样,要求AI有人味,好玩。 企业很多时候只看数据,希望你的AI有什么功能,成功率有多少。在这种情况下,AI企业肯定也会往“稳定,准确”的工具来训练。目的 就是生产为人使用的工具。

AI变成极致的工具,然后呢?

其实这也引发出了另一个话题,AI会让我们这个社会的评价体系变化,以往依赖可量化产出的评价体系可能被重塑。这点下次再讲吧。