Cursor 公布 Agent Swarm 实验:Grok 4.5 组合四小时通过 80% SQL 测试查询

本站收录 2026-07-21 08:30来源:https://cursor.com/blog/agent-swarm-model-economics

Cursor 官方博客发表长文《Agent swarms and the new model economics》,披露其 agent 集群(swarm)系统的一项内部实验:在隔离 SQLite 源码、测试集、可执行文件和互联网的环境下,agent 仅依据 835 页文档,用 Rust 从零实现数据库,再以 SQLite 项目的 sqllogictest 衡量标准答案一致率。Cursor 自报新集群在全部四种模型组合下均优于旧集群;使用 Grok 4.5 时,四小时约有 80% 的测试查询结果与标准答案一致,而对应旧集群运行不到两小时便被提前暂停。这里的 80% 不等于实现了 80% 的 SQLite 功能,也不能代表生产级兼容性、安全性或性能。

新集群的核心设计是围绕任务树的双角色分工:Planner agents(由最聪明的模型驱动)把目标递归拆分为可委派的基本工作单元,Worker agents(通常由更快、更便宜的模型驱动)执行这些单元。作者强调这一设计是更僵化编排系统的超集——不对问题施加固定拓扑,而是让树状结构随任务自然生长。文章还描述了去相关的多视角评审机制(review 的计算成本远低于被评审的工作本身,是高回报投入)与 stigmergy(环境塑形)式间接协调。

实验测试了四种模型组合:GPT-5.5 全程、Grok 4.5 全程、Opus 4.8 规划 + Composer 2.5 执行、Fable 5 规划 + Composer 2.5 执行。四小时截止时,新集群各组合通过率落在 73%–85% 区间,旧集群为 11%–77%;其中 Fable 5 混合组合在第一小时内通过约三分之二的测试。需要注意,旧版 Grok 4.5 在不足两小时就被暂停,不是完整的四小时对照;所有数字均来自 Cursor 的单轮内部实验,文章未给出重复实验、误差范围或统计显著性。

成本维度是文章的另一半论点:Cursor 认为「前沿模型规划 + 廉价模型执行」的混合策略可能以更低成本达到接近全程前沿模型的质量。公司称这套 swarm 已在内部用于发现并修复开源软件漏洞、提升测试覆盖率和生成合成训练数据,但没有说明它已成为对外可用的生产功能,也未开放 swarm 或专用版本控制系统源码;目前公开的只是一次 Opus 4.8 单模型运行的输出仓库。成绩均为厂商自报,尚无第三方复现。

本文相关产品

已复制,可直接粘贴给你的 AI