We introduce SIMA 2, a generalist embodied agent that understands and acts in a wide variety of 3D virtual worlds. Built upon a Gemini foundation model, SIMA 2 represents a significant step toward active, goal-directed interaction within an embodied environment. Unlike prior work (e.g., SIMA 1) limited to simple language commands, SIMA 2 acts as an interactive partner, capable of reasoning about high-level goals, conversing with the user, and handling complex instructions given through language and images. Across a diverse portfolio of games, SIMA 2 substantially closes the gap with human performance and demonstrates robust generalization to previously unseen environments, all while retaining the base model's core reasoning capabilities. Furthermore, we demonstrate a capacity for open-ended self-improvement: by leveraging Gemini to generate tasks and provide rewards, SIMA 2 can autonomously learn new skills from scratch in a new environment. This work validates a path toward creating versatile and continuously learning agents for both virtual and, eventually, physical worlds.
核心贡献 · Key contributions
提出 SIMA 2,一个基于 Gemini 的通用具身智能体,能够在 3D 世界中进行推理、对话并遵循复杂指令。 Introduces SIMA 2, a generalist embodied agent built on Gemini, capable of reasoning, dialogue, and complex instruction following in 3D worlds.
展示了对未见环境的鲁棒泛化能力,包括 Genie 3 生成的照片级真实世界,缩小了与人类表现的差距。 Demonstrates robust generalization to unseen environments, including photorealistic worlds from Genie 3, closing the gap with human performance.
通过 Gemini 生成的任务和奖励展示了开放式自我改进,使智能体能在新环境中自主习得技能。 Shows open-ended self-improvement via Gemini-generated tasks and rewards, enabling autonomous skill acquisition in novel environments.
在针对具身动作微调后保留了 Gemini 的核心推理能力,在编程、数学和科学基准上仅有微小退化。 Preserves Gemini's core reasoning abilities after fine-tuning for embodied action, with minimal regression on coding, math, and science benchmarks.
支持与更强大的 Gemini 模型分层组合以实现高级推理,例如解析复杂图表完成多步骤任务。 Enables hierarchical composition with a more powerful Gemini model for advanced reasoning, e.g., parsing complex diagrams for multi-step tasks.
通过多样化 3D 游戏训练,验证了通往适用于虚拟和物理世界的通用、持续学习智能体的路径。 Validates a path toward versatile, continuously learning agents for virtual and physical worlds through diverse 3D game training.
局限 · Limitations
由于运动难度和瞬间决策,战斗任务的表现仍然较低。 Performance on combat tasks remains low due to motor difficulty and split-second decision making.
对保留环境的泛化虽有改进,但在某些任务上仍落后于人类新手表现。 Generalization to held-out environments, while improved, still lags behind human naive performance in some tasks.
自我改进过程依赖 Gemini 生成任务和奖励,可能引入偏差或限制。 Self-improvement process relies on Gemini for task generation and reward, which may introduce biases or limitations.
评估仅限于虚拟 3D 世界;向物理机器人的迁移仍是未来工作。 Evaluation is limited to virtual 3D worlds; transfer to physical robotics remains future work.
具身动作的延迟约束要求使用较小的 Gemini 模型,限制了与更大变体相比的推理能力。 Latency constraints of embodied action require using a smaller Gemini model, limiting reasoning capacity compared to larger variants.
论文章节 · Sections(共 17)
摘要Abstract
1 引言1 Introduction
2 背景与相关工作2 Background & Related Works
3.1 环境3.1 Environments
3.2 智能体-环境接口3.2 Agent-Environment Interface
3.3 数据、智能体与训练3.3 Data, Agent & Training
3.4 评估3.4 Evaluations
4.1 新能力4.1 New Capabilities
4.2 具身任务表现4.2 Embodied Task Performance
4.3 与基线 Gemini 模型对比4.3 Comparison to Baseline Gemini Models
4.4 Gemini 指导 SIMA 24.4 Gemini Instructing SIMA 2
4.5 自我改进4.5 Self-Improvement
5 讨论5 Discussion
致谢Acknowledgments
SIMA 2 团队SIMA 2 Team
附录 B Gemini Pro 与 SIMA 2 结合的额外结果Appendix B Additional Results Combining Gemini Pro & SIMA 2
附录 C 额外自我改进结果Appendix C Additional Self-Improvement Results