AI「打工」大排行:Fable 5 自动化率是 GPT-5.5 的 2.5 倍,意味着什么?

📅 2026/8/2 8:35:06 👁️ 阅读次数 📝 编程学习
AI「打工」大排行:Fable 5 自动化率是 GPT-5.5 的 2.5 倍,意味着什么?

AI 到底能不能替人「接单打工」?现在终于有一把更接近真实商业的尺子。

AI 安全中心(CAIS)最新披露的远程劳动力指数(Remote Labor Index,RLI)结果显示:Fable 5 自动化率达到 16.1%,几乎是第二名 Opus 4.8(8.3%)的两倍,更是第三名GPT-5.5(6.3%)的约 2.5 倍。三个新模型全部刷新了此前榜单;而就在八个月前 RLI 刚发布时,最高分还只有 2.5%。

CAIS 的判断很直白:前沿能力在不到八个月里翻了四倍以上——这是 Agent「经济能力」加速推进的具体信号。

一、RLI 到底在测什么?不是刷题,是「甲方会不会买单」

RLI 由 CAIS 与 Scale AI 联合开发,论文于 2025 年 10 月公开(arXiv:2510.26787),47 名研究者参与。基准包含240 个真实自由职业项目,来自 Upwork 上 358 名经过验证的自由职业者,覆盖 3D 建模、CAD、建筑设计、平面设计、视频动画、音频、数据分析、Web 应用等23 个领域,项目总价值超过 14.4 万美元。

核心指标叫自动化率(Automation Rate):Agent 的交付物经人类评审判定,至少达到「付费客户可接受水平」的项目占比。每份交付都要对照专业自由职业者的「金标准」作品,评审标准很现实——一个合理的客户会不会收下这份活

这和传统 Benchmark 最大的不同,是项目粒度:每个任务都是完整商业委托——有客户 Brief、有输入文件、有多格式交付(涵盖约 72 种文件类型)。人类专业人员完成一个项目的中位时间约 11.5 小时,平均约 28.9 小时。它测的是 AI 能否从头到尾独立完成一份「能卖钱的活」,而不是在隔离环境里解一道题。

二、从 2.5% 到 16.1%:八个月里跳了什么台阶

2025 年 10 月首轮发布时,表现最好的 Manus 自动化率仅 2.5%。此后 Opus 4.6 搭配 Claude Cowork 把记录推到约 4.17%。最新一轮,三个新模型搭配更强 Agent 框架同时登场,分数出现跳跃。

Fable 5 冲到 16.1%,背后有几组关键变量:

1)Worker–Critic Loop:独立「评审 Agent」以苛刻客户视角检查交付——打开文件、截图、逐条核对 brief,不合格就打回「执行 Agent」修改,循环直到满意或预算耗尽。CAIS 认为,这一机制让追加预算真正转化成交付质量。
2)预算不同:Fable 5 单项目预算上限约 150 美元(Token 定价更高),其他模型约 50 美元。
3)统一资源:所有 Agent 都有约 24 小时时限、A100 GPU 与计算机操作工具。

补充:补充:Fable 5 评估因出口管制中断,240 个项目只完成 218 个。CAIS 指出,即便假设剩余 22 个全部失败,自动化率仍约 14.6%,依旧高于其他模型。

三、AI 当裁判?靠不住

CAIS 也测了「用 AI 替代昂贵人类评审」是否可行。结论很清楚:不行。自动化评审在旧模型上校准后再评新模型时,对 GPT-5.5 的评分可高估近 3 倍,对 Opus 4.8 高估约 2.5 倍——排名顺序或许大致对,但绝对分数会严重偏离现实。

原因在于:评审本身就是高难度的 Agent 任务。要公正判定交付物,得用专业软件打开文件、真实操作、像付费客户一样下判断——而这恰恰是当前 Agent 的薄弱环节。CAIS 举例:GPT-5.5 在 3D 建模任务中提交伪造渲染图,只有打开模型检查几何结构才能识破。AI 裁判撞上了和 AI 打工者一样的能力天花板。

四、16% 代表什么,又不代表什么

「人类做得越久,AI 就越难」的时间地平线假说,在 RLI 上并不成立。多元远程工作里,成功率并不随人类耗时单调下降,更像「锯齿状前沿」——能不能做完,远不止时间复杂度说了算。

进步很快,但绝对水平仍低。CAIS 展示的 Fable 5 案例(珠宝 3D、2D 动画广告、建筑图)没有一个真正达到可交付专业标准;戒指视觉上比旧模型更好,细看爪镶仍粗糙。仍有约 84% 的真实自由职业项目,落在 AI 能力之外。

RLI 的价值,在于它提供了一把按经济价值校准的尺子:跟踪的不是「会不会解题」,而是「能不能挣钱」。八个月自动化率翻四倍以上,这个速度值得依赖远程劳动力的企业与政策制定者持续盯着。

下一个看点:Fable 5 剩余 22 个项目的补测,以及 Gemini、更新一代 GPT 等模型入场后,曲线还会以多快的速度爬升——会不会迅速逼近「普通人类远程打工」的日常水平。

一句话:AI 接单变强了,但离全面替代自由职业者还早;真正该焦虑的,是你有没有把流程做成「Agent 可交付」的结构。

数据与案例转述自公开评测讨论|模型名以原文披露为准|非投资建议