ARTICLE · 人工智能
不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界
一语总结中科院自动化所提出 PhiZero,用自监督学习的“物理语言”抽象世界状态变化,以先推理再渲染的方式生成物理一致视频,并支持跨形态迁移与具身智能应用。
文章由论文作者介绍中科院自动化所提出的 PhiZero 世界模型。PhiZero 的核心是自监督学习得到的物理语言:一种紧凑离散符号,用来表达物体如何运动和交互、世界状态如何演化,与静态外观解耦。模型采用 Reason-then-Render 范式,先用 Physical Language Tokenizer 将状态变化压缩为符号序列,再由 Reasoner 预测未来物理语言,最终由扩散解码器渲染成视频。一段 4 秒 512×896 视频只需 256 个物理语言符号,而常规视频 VAE 需要 44800 个视觉 token。PhiZero 支持 Motion Transfer、人机形态迁移、sim-to-real、可交互 Image-to-World 探索及驾驶/机器人动作条件生成;在 Physics-IQ Verified、PhyGround、WorldModelBench 等生成基准及 IntPhys2、LikePhys、YoCausal 等理解基准上取得领先或竞争力表现。文章最后展望物理语言作为 AI 与真实世界接口的潜力。
- 自然语言适合描述数字世界,物理世界需要一套表达状态演化的“物理语言”。
PhiZero 提出用紧凑离散符号表达物体如何运动和交互,与外观解耦,使同一段状态转移可迁移到不同形态。
- PhiZero 采用 Reason-then-Render 范式,先自回归推理物理语言,再渲染视频。
物理语言 Tokenizer 从视频中提取状态变化并压缩为离散符号,Reasoner 以当前画面和动作意图预测未来符号序列,最后由扩散解码器补全视觉细节。
- 仅用 256 个物理语言符号即可表示一段四秒视频的状态转移。
相比常规视频 VAE 的 44800 个视觉 token,物理语言大幅压缩,同时保留碰撞、流体、爆炸等支撑世界演化的关键信息。
- 物理语言从约 5 万小时真实视频中自监督涌现,无需预设物理规则。
经过分层筛选得到约 1 万小时训练数据和 100 万个运动显著片段,模型通过压缩、重建与预测学习哪些变化模式值得记录。
- 物理语言同时可用于视频生成与物理理解,在多项基准上领先。
在 Physics-IQ Verified、PhyGround、WorldModelBench 等生成基准以及 IntPhys2、LikePhys、YoCausal 等理解基准上均有竞争力或领先表现。
不再困于自然语言!中科院自动化所最新推出 PhiZero,用“物理语言”帮助世界模型理解世界
文章由论文作者介绍中科院自动化所提出的 PhiZero 世界模型。PhiZero 的核心是自监督学习得到的物理语言:一种紧凑离散符号,用来表达物体如何运动和交互、世界状态如何演化,与静态外观解耦。模型采用 Reason-then-Render 范式,先用 Physical Language Tokenizer 将状态变化压缩为符号序列,再由 Reasoner 预测未来物理语言,最终由扩散解码器渲染成视频。一段 4 秒 512×896 视频只需 256 个物理语言符号,而常规视频 VAE 需要 44800 个视觉 token。PhiZero 支持 Motion Transfer、人机形态迁移、sim-to-real、可交互 Image-to-World 探索及驾驶/机器人动作条件生成;在 Physics-IQ Verified、PhyGround、WorldModelBench 等生成基准及 IntPhys2、LikePhys、YoCausal 等理解基准上取得领先或竞争力表现。文章最后展望物理语言作为 AI 与真实世界接口的潜力。
文章金句
"让 AI 不只看见世界,也学会用世界自己的语言,理解它将如何变化。
"视觉上的“像”,并不等于物理上的“对”。
"物体如何运动和交互,世界状态如何从此刻持续演化到下一刻。