ARTICLE · 人工智能

不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界

作者:青稞AI 来源:青稞AI 2026-08-08 00:00 14 分钟 13 阅读 3442 字
世界模型视频生成具身智能物理语言模型训练与推理
一语总结

中科院自动化所提出 PhiZero,用自监督学习的“物理语言”抽象世界状态变化,以先推理再渲染的方式生成物理一致视频,并支持跨形态迁移与具身智能应用。

AI 总结

文章由论文作者介绍中科院自动化所提出的 PhiZero 世界模型。PhiZero 的核心是自监督学习得到的物理语言:一种紧凑离散符号,用来表达物体如何运动和交互、世界状态如何演化,与静态外观解耦。模型采用 Reason-then-Render 范式,先用 Physical Language Tokenizer 将状态变化压缩为符号序列,再由 Reasoner 预测未来物理语言,最终由扩散解码器渲染成视频。一段 4 秒 512×896 视频只需 256 个物理语言符号,而常规视频 VAE 需要 44800 个视觉 token。PhiZero 支持 Motion Transfer、人机形态迁移、sim-to-real、可交互 Image-to-World 探索及驾驶/机器人动作条件生成;在 Physics-IQ Verified、PhyGround、WorldModelBench 等生成基准及 IntPhys2、LikePhys、YoCausal 等理解基准上取得领先或竞争力表现。文章最后展望物理语言作为 AI 与真实世界接口的潜力。

核心要点
  1. 自然语言适合描述数字世界,物理世界需要一套表达状态演化的“物理语言”。

    PhiZero 提出用紧凑离散符号表达物体如何运动和交互,与外观解耦,使同一段状态转移可迁移到不同形态。

  2. PhiZero 采用 Reason-then-Render 范式,先自回归推理物理语言,再渲染视频。

    物理语言 Tokenizer 从视频中提取状态变化并压缩为离散符号,Reasoner 以当前画面和动作意图预测未来符号序列,最后由扩散解码器补全视觉细节。

  3. 仅用 256 个物理语言符号即可表示一段四秒视频的状态转移。

    相比常规视频 VAE 的 44800 个视觉 token,物理语言大幅压缩,同时保留碰撞、流体、爆炸等支撑世界演化的关键信息。

  4. 物理语言从约 5 万小时真实视频中自监督涌现,无需预设物理规则。

    经过分层筛选得到约 1 万小时训练数据和 100 万个运动显著片段,模型通过压缩、重建与预测学习哪些变化模式值得记录。

  5. 物理语言同时可用于视频生成与物理理解,在多项基准上领先。

    在 Physics-IQ Verified、PhyGround、WorldModelBench 等生成基准以及 IntPhys2、LikePhys、YoCausal 等理解基准上均有竞争力或领先表现。

不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界

文章由论文作者介绍中科院自动化所提出的 PhiZero 世界模型。PhiZero 的核心是自监督学习得到的物理语言:一种紧凑离散符号,用来表达物体如何运动和交互、世界状态如何演化,与静态外观解耦。模型采用 Reason-then-Render 范式,先用 Physical Language Tokenizer 将状态变化压缩为符号序列,再由 Reasoner 预测未来物理语言,最终由扩散解码器渲染成视频。一段 4 秒 512×896 视频只需 256 个物理语言符号,而常规视频 VAE 需要 44800 个视觉 token。PhiZero 支持 Motion Transfer、人机形态迁移、sim-to-real、可交互 Image-to-World 探索及驾驶/机器人动作条件生成;在 Physics-IQ Verified、PhyGround、WorldModelBench 等生成基准及 IntPhys2、LikePhys、YoCausal 等理解基准上取得领先或竞争力表现。文章最后展望物理语言作为 AI 与真实世界接口的潜力。

文章金句

"

让 AI 不只看见世界,也学会用世界自己的语言,理解它将如何变化。

"

视觉上的“像”,并不等于物理上的“对”。

"

物体如何运动和交互,世界状态如何从此刻持续演化到下一刻。