开发者 3 秒速决决策指标
AI at Meta 公布 Muse Spark 1.2 的多模态能力:可把视觉输入转成可运行代码,也能把感知转成物理动作。演示包括根据图像或视频生成网页与游戏,并用渲染与行为结果做自我改进;以及作为机器人“大脑”拆解指令、调用工具、观察结果直到完成,例如双臂整理桌面。该模型还用于内部媒体生成与下游信号抽取。
核心要点速览 (Key Takeaways)
- ✓Muse Spark 1.2 能把图像/视频的布局与风格翻译成可运行网页和游戏代码,并按真实渲染结果迭代。
- ✓专用变体可编排机器人工具循环,完成非结构化环境中的多步操作。
- ✓内部已用于媒体生成与跨文本、图像、视频的信号抽取。
阅读完核心要点?进一步了解模型实力与实际开销
7 大权威镜像天梯跑分与 29+ 款主流编程套餐横向比价测算
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察