Meta超级智能实验室9月2日发布Muse Spark 1.3,当日起在终端编码代理Muse Code和Meta Model API上线。这是五个月内Muse Spark系列的第四次迭代,上一代1.2于8月5日与Muse Code一同推出。新模型权重保持封闭,既有推理档位同步可用,最高推理档(max)仍需完成额外安全测试后才会开放。
性能对标一线模型,编码与代理是主战场
首席人工智能官亚历山大·王对媒体表示,这是迄今最大的模型性能跃升,编码与代理自动化是主攻方向。他称1.3与Anthropic的Claude Fable 5.1“有竞争力”,编码表现“好于”OpenAI的GPT-5.6 Sol。马克·扎克伯格在社交媒体上写道,这是“编码和代理作业上迄今最大的飞跃”,并称其拥有“便宜到几乎不必计量的前沿性能”。
相对上一代1.2,公司工程师内部对比显示工具调用减少约20%、token消耗减少约25%,模型“少说废话、少绕不必要的回合”。上下文窗口维持在100万token,输入支持文本、图像和视频。标准API定价未变:每百万token输入1.25美元、输出4.25美元,缓存命中0.15美元。贡献者档价格更低,条件为允许Meta使用提交内容改进模型。
第三方评测进入第一梯队,max档仍限合作伙伴
独立评测机构Artificial Analysis给公开档1.3(xhigh)的Intelligence Index打出61分,与GPT-5.6 Sol(max)、Grok 4.6(high)并列;面向合作伙伴的1.3(max)为62分,仅次于Claude Fable 5.1与Claude Opus 5。该机构指出,xhigh在59分以上模型里单任务成本最低,约0.55美元,同档对手约0.94至0.95美元。不过,由于代理评测中输入token较1.2增加约57%,单任务成本从约0.40美元升至0.55美元。
在具体基准上,Tau3-Bench Banking从1.2的35%升至xhigh的47%、max的52%;Terminal-Bench 2.1从80%升至85%;GDPval-AA v2 Elo从1615升至xhigh的1709、max的1754。max靠更多回合和推理token拉分:相对xhigh,GDPval推理量约高62%,Tau3约高28%。Meta自报的DeepSWE v1.1为75.4,对照表中1.2为55、GPT-5.6 Sol为73、Claude Opus 5为74。两套数字口径不同,不能直接加总比较。
社交产品即将更新,更大模型仍在训练
1.3将在数日内进入Facebook、Instagram和Meta AI应用,但公司未给出精确日期。亚历山大·王称定价“进取”,安全与对齐投入已明显加码,“还没有被迫暂停,但要确保不撞到护栏”。更大代号为Watermelon的模型仍在开发,发布时间未定。扎克伯格此前曾表示会开源某一代Spark权重,但本版仍为闭源收费接口。
五个月内四次发布,将Meta从落后一档推到与Claude Fable、GPT-5.6、Grok同场比较的位置。目前公开可用的是xhigh档,而非性能更高的max档。价格锁定在1.2水平,但代理任务导致的token消耗上升,意味着实际使用成本可能增加。下一次可核对的时间点,是max档完成安全测试并开放,以及社交产品中的实际替换进展。