Claude Code 被指浪费 Token,实验揭示 harness 对 Agent 成本影响超模型!
【导语:Composio 团队实验对比 Claude Code、Hermes 和 Kimi Code 等不同 agent 框架(harness),揭示了它们在任务成功率、token 消耗和速度方面的差异,凸显了 harness 对降低 agent 成本的重要性。】
Composio 团队进行了一项有趣的对比实验,用同一模型 Kimi K3 分别在 Claude Code、Hermes 和 Kimi Code 三个 harness 里跑 28 个相同任务。结果显示,三者任务成功率差距不大,Kimi Code 成功 22 个,Hermes 成功 21 个,Claude Code 成功 20 个。然而,在 token 消耗方面,Claude Code 却远远高于其他两者。中位数来看,Kimi Code 约用 6.1 万 token,Hermes 约 6.7 万,而 Claude Code 直接飙到 34 万,约是 Kimi Code 的 6 倍。按 Kimi K3 每百万输入 token 3 美元的价格算,平均每个任务成本,Kimi Code 为 0.22 美元,Hermes 为 0.28 美元,Claude Code 则高达 2 美元。
在速度方面,不同 harness 也表现出明显差异。中位数耗时上,Hermes 最快,为 179 秒;Kimi Code 为 297 秒;Claude Code 最慢,为 348 秒。由此可见,最快的 Hermes 和最省 token 的 Kimi Code 并不重合。
Sebastian Raschka 分析发现,Claude Code 在成功率相近的情况下,token 用量往往是其他很多 harness 的 2 到 3 倍。差异主要出在输入 token,而非输出 token。日志显示,Claude 的 harness 在多轮交互中会反复把更多上下文塞回模型,包括之前的消息、工具调用、命令输出和文件内容。例如某次 Claude 跑完用了约 57.8 万输入 token,但输出只有约 4500 token,跨了 25 轮。这表明 Claude 的 harness 在多步 agent 运行时,会累积或计入更大的 prompt 端历史。
Writer 公司的论文通过控制变量实验进一步证明了 harness 的重要性。在 22 个企业任务和 6 个基础模型固定不变的前提下,仅替换编排层为自家 Harness,实验结果显示:每项任务平均成本降低 41%(从 0.21 美元降至 0.12 美元),中位延迟缩短 44%(从 48 秒降至 27 秒),Token 消耗量减少 38%(从 14.2k 降至 8.8k),而任务完成质量基本持平。在性价比方面,每美元成本所能获得的质量提升高达 82%,每百万 Token 能完成的任务数从 54.9 跃升至 92.0。
编辑观点:实验结果清晰表明 harness 对 Agent 成本和效率影响重大,未来 Agent 竞赛中,harness 将成为关键竞争点,企业和开发者需重视其优化。