Meta 的 Muse Code 自带崩溃安全日志,但 Claude Opus 5 在基准测试中仍然领先。
Meta公司周三发布了基于终端的编码代理程序Muse Code(测试版)。 该公司公布的图表显示,该模型在大多数编码测试中击败了OpenAI的Codex和谷歌的Antigravity,但在Meta发布的所有基准测试中均败给了Anthropic的Claude Opus 5。
Muse Code 的功能不如 Opus 5,但它增加了一个崩溃安全日志。
Muse Code 由 Muse Spark 1.2 提供支持,这是 Meta 编码模型的更新版本,于 7 月向美国开发者开放。.
在Meta公布的编码基准测试中,Muse Spark 1.2 的表现落后于 Opus 5,但在大多数测试中都优于 Codex 和 Antigravity。Meta 表示,该模型是其“迈向前沿的下一步,更大、功能更强大的模型正在研发中”。
该公司表示,1.2 版本在训练期间增加了用于编码任务的计算量,从而在代码生成、调试和理解大型代码库方面表现更佳。.
在一个案例研究中,该模型对 NVIDIA Hopper 芯片的 GPU 内核进行了重写,进行了 1000 多次工具调用,持续时间长达 24 小时,并且从一个被告知不要从现有库中复制的基线开始工作。.
Muse Code 维护着一个本地事件日志,记录所有模型调用、工具运行、审批和编辑操作。“这种单一数据源确保了运行时的可重现性和重启安全性,”Meta 在其 博客文章 ,并提及了该日志。
如果发生崩溃,代理程序可以从中断处继续运行。此外,代理程序还会让后台子代理程序在整个会话期间保持运行。.
Meta 首席执行官马克·扎克伯格在一篇 博文:“当任务足够大时,它会被拆分成多个子代理,在各自独立的工作树中并行工作。” 他继续说道:“你的工作副本永远不会被修改。在测试中,我们让它同时为一个游戏构建六个功能,没有出现任何冲突。”
今天发布 Muse Code 的 Beta 版。它是一款终端编码代理,能够处理大型代码库中的完整软件工程任务:规划变更、编写代码、验证结果。它基于 Muse Spark 1.2,这是一项以编码为中心的模型更新。pic.twitter.com/ xqavk41w6v
——马克·扎克伯格(@finkd) 2026年8月5日
/plan、/grill 以及 Meta 对成本的押注
Muse Code 内置了多个命令。/plan 命令可以将请求转化为需要审批的计划,/grill 命令会对该计划进行压力测试直至其生效,而 /goal 命令则会推动项目朝着既定目标的实现前进。.
开发者只需一条 curl 命令即可在 macOS 或 Linux 上安装代理。Muse Spark 1.2 也可通过 Meta Model API。
模型和代理协同工作。Muse Code 工具集确保它们兼容。.
部分训练数据由旧版 Muse Spark 1.1,该版本会生成硬编码问题并对候选答案进行评分。Meta 表示,这种循环有助于新模型更好地遵循指令。
Meta公司告诉投资者,预计今年将在芯片、数据中心和其他基础设施方面投入1250亿美元至1450亿美元。.
由于 Opus 5 在基准测试中表现不佳,该公司转而依靠价格优势展开竞争。一款代号为“西瓜”(Watermelon)的大型 Meta AI 模型仍在训练中。.
不要只是阅读加密货币新闻,要理解它。订阅我们的新闻简报, 完全免费。









