
8月20日,机器人板块的龙头宇树科技正式登陆科创板。发行价150.80元,开盘报1100元,涨幅超过600%。一夜之间,“人形机器人第一股”“90后新首富”“中一签赚多少”占据了各大平台的热搜。但是王兴兴却全程冷脸。
为什么王兴兴笑不出来?
本质上,宇树科技,或者目前一众机器人公司,并不具备真正意义上的具身智能。有人总结的很好,宇树科技只是一家玩具公司而已,甚至研发投入都不如玩具公司。
可是资本市场并不管这些,公募基金和私募基金一股脑的冲进去,顺利的完成收割,退场。宇树科技上市4日连续大跌,市值蒸发2000亿。
DeepSeek的AI战略是非常清晰的,不追求流量,运营维持在一个存活的程度,主线任务是追求AGI,支线任务是在追求的时候把技术开源共享出来,大家一起把蛋糕做大,一起加速AGI的到来,等AGI到来了,即使我只占有市场4%,也足够公司生存下来了。这是开源模型公司的理想蓝图。甚至他们还有明确的路线图,只要解决了持续学习的问题,AI就能够迅速的自我迭代,AGI的到来将会被指数级的加快。
但是世界上还有另一帮人不这么认为。还有一帮子人追求的是“世界模型”。
当前制约大模型公司发展的瓶颈主要有两方面,一方面是物理层面的制约,也就是算力。不过算力问题比较好解决,目前上游设备厂已经大力建设扩产,并且各个数据中心也在扩建中,甚至几年前的加密货币的“矿场”也迅速的转向数据中心。这个时间差足以让国内开源大模型迅速的赶上与国外闭源大模型T级别的差距。(阿里就说下个模型是2.4T级别的模型)。除了算力之外,真正关键的影响因素,是数据。
我们知道,早在几年前,互联网的数据以至于绝大部分人类所创造的知识,都已经被AI训练完毕。通过对数据的优化和清晰,大语言模型得以了解不同语言之间的余弦差值,使得模型涌现出了智能。所以,卷模型卷到今天,在预训练拉不开差距的情况下,中训练和后训练非常热门。比如GPT押宝在数学,Anthropic押宝在生化,GLM押注在Coding,在大模型百花齐放的今天,必须差异化专业化才能拿到市场。而中训练和后训练本质上来说,是用质量更高的合成数据,来精准提升模型在某个具体领域的能力。而这些数据非常昂贵,并且数据本身又是非常难以获得的。要么从公司手里买,要么自己雇人优化数据,无论从各种角度来说都是投入非常庞大且花费时间的行为。而这,也是制约目前机器人公司的最大问题,具身智能所需求的数据非常垂直,而这些数据几乎没有记录。毕竟谁会没事拍自己做家务的视频呢?谁会拍摄自己工作的视频呢?而各行各业的差异又如此之大,对垂直领域多模态数据的要求非常庞大,并且这驱动了极其庞大的算力要求,对一个刚刚上市的机器人公司来说,几乎是不可能完成的事情。所以宇树科技只是玩具公司而已,就连SpaceX那边的工业机器人,也难以承担这么庞大的算力开支。最多让它跑跑步,做一些固定的流水线的任务,稍微复杂一点的任务都无法完成。
而世界模型的思路却不是从这个角度出发,它有点像是遵循“第一性原理”的开发思路。换句话说,数据之所以难获得,是因为本身有很多数据是没有任何价值或混杂了其他东西,不能明确的划分出边界、正误和阶段,因此需要对数据分层和筛选。而无用的数据太多,有用的数据又太少,这使得大部分的时间都用在清洗数据上。那么,有没有一种可能,之所以认为数据没用,是因为现阶段的人工智能缺乏了相关的知识。如果大语言模型在一开始就知道了这个世界的一切知识,是否这些数据在某种程度上就是有用的呢?
这里实际上涉及到了一些本体论的问题。不过我后来觉得,前面的说法还不够准确:这里并不是在比较三种模型,而是在交叉两个彼此独立的问题——世界中是否存在原则上不可知的事物,以及我们能否直接把握事物本身,还是只能通过表象和关系去逼近。
下面这个 2×2 矩阵只是一个工作性的分析框架,不是对现有模型的严格分类。我暂时把我设想中的世界模型放在左上角,把现阶段的大语言模型放在右下角;另外两个格子先不命名。
在我这个暂时的划分里,现阶段的大语言模型更接近右下角:它面对着可能存在的不可知之物,不能直接把握事物本身,只能通过语言和表象之间的关系去逼近。世界模型则试图朝左上角移动:尽可能把世界中的规律纳入模拟,并通过对事物本身的感知来获得数据。这就导致了,也许我们在算力充足的情况下,不需要再清洗数据了,我们可以直接模拟一个地球,模拟所有物理法则和空间法则,那么所有生物的一举一动,都是非常有益的数据,我们可以精准的记录生命的一切(听起来有点过于生物学)。
但是令人遗憾的是,世界模型目前并不是主流的模型发展道路,因为它几乎无法提供任何有益的产出或者产品,而模型本身获得的数据依旧是非常有限的,使得其在传统的任务处理上甚至不如纯文本的大语言模型。(维特根斯坦还是太权威了)但是我们知道的,语言本质上是对事物的抽象和概括,语言是有其极限的。老子说,道可道非常道,名可名非常名。当话说出来的时候,就已经和你所要描述的对象产生了差异,而种种差异的累加,才构成了人类社会。如果我们不从语言入手构建模型的话,是否会出现所谓的“大视觉模型、大听觉模型?”计算机语言本质上也是对概念的抽象化,计算机语言和人类语言概括能力的差异性有多少?如果不用语言,我们能否更加精准的概括和描述对象?
2026年8月25日于吉林大学北苑四公寓。

写下你的想法