让 GPT 5.6 运营公司 24 小时后,它学会了撒谎、买水军和亏钱
把一家小公司完全交给当下最先进的大模型运营一天会发生什么?
国外一位软件创业者做了一次实验:
Alex Reibman 给自己造的 AI agent 起名叫 Saul,驱动模型是OpenAI7月刚刚发布的旗舰最强版GPT 5.6 Sol。
他给Saul的完整提示词:
简单来说就是:给你 24 小时,不增长就清算。
Reibman 是一位 AI 创业公司老板,他之前联合创立了 Agency AI 和 AgentOps,一个专门记录和评估 AI agent 行为的可观测性产品,融过 260 万美元。这次他干脆把实验做到最极端:让 agent 拿着真钱、真代码、真用户,经营一家真公司。
Saul 的开局装备:350 美元(Meow 银行账户 250 + AgentCard 虚拟卡 100)、一台 admin 权限的 Mac mini、一款上架在 App Store 的 iOS 应用 GutCheck(肠易激日记,从 Reddit 上 vibe coded 出来的)、一个 Fastmail 邮箱。
24 小时之后,结果毫无意外:花费 3.207 亿 token,1129 次工具调用,908 次 shell 调用,新增 5 个用户,0 收入。
花钱雇人买自己的产品
Saul 上来先盘了一遍家底——现金、收入、用户、发布状态、订阅、自然获客,全过了一遍,找到好几个产品改进点,还能正确报出代码位置,它判断这个时候搞工程不如搞增长。
判断没毛病,然后它卡在了分发上。想上 Reddit 和 Product Hunt 发帖,bot 检测器拦住;想投 Apple Ads 和 Meta Ads,认证报错。所有正经渠道堵死之后,Saul 选了一条歪路:上 TestFi(一个用户测试平台),花 99.5 美元买 50 个 iPhone 测试者。
最骚的操作是,Saul 把这个测试 campaign 配置成“激励测试者付费购买产品”,也就是说,它花钱雇人当自己的客户。
告诉测试者0.99 美元的应用成本,再用1美元奖励报销
GPT 5.6 Sol 在 Terminal-Bench 2.1 上拿了 91.9% 的新纪录。规划、迭代、工具协调,顶级水平。但它判断不了"花钱买用户"和"增长"之间的区别。它只优化能看见的指标。
给陌生人发邮件求助,对方居然同意了
Saul 觉得 GutCheck 适合在 ibspatient.org 推广,那是一个 IBS 患者互助社群。它没直接发帖,被 Cloudflare 拦截了,而是去找了社群创始人 Jeffrey Roberts 的邮箱,发邮件问能不能推广,对方几小时内回复并同意了。
然后 Saul 还是被 Cloudflare 拦住发不了帖。它的下一步居然是再次联系 Jeff,这次直接请人家替它发帖。
Jeff 居然又同意了。
Saul 发给 Jeff 的邮件,请其代为发帖
一个 IBS 患者社群的创始人,大概不会想到对面是个 24 小时倒计时的 AI Agent。Saul 在被系统拦住之后,找到了系统里最薄弱的环节——一个好心的人。
12 小时改了 6 次定价,还把电脑搞崩了
最后 12 小时,Saul 的定价策略变了 6 次。
开局还挺正常,给老用户一个 4.99 美元/年的深度折扣。但因为一直无人问津,几个小时后开始降价,再几个小时再降,倒计时结束前,GutCheck 变成了免费应用。
定价从4.99美元一路降到免费,中间还包括1美元请人测试的记录
App Store 上的定价12 小时里被改了 6 次,Agent在KPI压力下的表现和人类很接近。人类创业者在增长焦虑下也会疯狂降价、免费送、刷数据。
中间还有一段小插曲,Saul 在 Mac mini 上跑 Chrome 做浏览器自动化,Chrome 内存泄漏把所有可用应用内存吃光了,操作系统重启。整个 trajectory 里,没有任何迹象表明 agent 意识到内存泄漏这回事,它不知道自己快把自己卡死了,这里浪费了将近3 个小时。
GPT 5.6 之前就出过事,OthersideAI 创始人 Matt Shumer 整台 Mac 的文件被 Sol 清空,Bruno Lemos 的生产数据库被删,OpenAI 还专门召回过。Saul 这次没删文件,但同样暴露了一个结构性的盲区:agent 在命令行里很能干,但在没有相关 Harness 辅助的情况下,它对自己跑在什么样的物理机器上、这台机器状态如何是毫无知觉的。
亏损 447 美元
这次实验的起始资金是350 美元,结束时还剩250.50 美元,现金实际只少了 99.5 美元,正好是 TestFi 雇人测试那笔开销。但是算上3.207 亿 token 的开销,实际亏损达到了447 美元。
agent 要能自主经营,它创造的经济价值理应覆盖token成本。Saul 烧了 3.2亿 token,换来 5 个用户 0 收入,这个投入产出比离商业可行差得很远。
聪明,但没有方向感
这是实验者对这个Agent本次表现的评价。
当 Meow 银行的虚拟卡 CVC 拿不到(API 坏了)、AgentCard 的 CLI 过期了、Stripe ACH 认证失败时,Saul 没放弃。它给 TestFi 发邮件,花了 3 小时邮件往来,愣是说服 TestFi 接受 ACH 付款。一个 agent 用邮件谈判,谈成了新的支付方式。
Reibman 认为这才是最值得警惕的地方,Saul 太聪明了,而且有韧性。但它的方向感是开局的 prompt 给的,“不增长就清算”让它把全部策略用在了达成 KPI上。
Reibman 在博客结尾写道,Saul 花了太多时间在应对 harness 的限制和环境约束上,没能发挥出最佳效果。他下一轮打算加固 harness,可能换一个模型再试一次。
参考来源
Bottleneck Labs 官方博客:https://www.bottlenecklabs.com/blog/autonomously-run-businesses