三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

8月13日AI格局日报:三箭齐发之夜与Harness前夜倒计时

8月13日AI格局日报:三箭齐发之夜与Harness前夜倒计时

摘要

2026年8月12日深夜至13日凌晨,全球AI圈经历了2026年迄今最密集的"发布之夜":DeepSeek V4 Pro 0813正式版静默上线(Agent能力暴涨390%,逼近Claude Fable 5)、Grok 4.6正式发布(GDPVal-AA v2第一,定价竞品一半)、Qwen 3.8-2.4T-A95B首次开放Max级权重。与此同时,马斯克在SpaceX全员会上预言AI收入9月超越航天主业,DeepSeek Harness智能体框架团队公众号正式落地,地方国资密集入局Token运营中心,聚合接口整合16家厂商免费额度。前沿模型发布周期从"季度"压缩至"同夜",中国开源模型全球调用量份额达63.5%,AI竞争进入"后训练+Harness+生态"的新阶段。

核心结论8月13日是2026年AI竞争的分水岭之夜。三款前沿模型同夜竞速标志着发布节奏的极限压缩,DeepSeek Harness即将亮相预示Agent竞争从"模型层"下沉至"框架层",而马斯克的SpaceX AI战略转身意味着算力、带宽和终端入口的全面重组。8月第三周(8/15 Google Cloud Next + Kimi G轮截止 / 8/19 机器人大会 / 8/21前 Grok 4.7)将成为验证这些趋势的关键窗口。


一、今日核心动态速览

序号事件重要度一句话
1DeepSeek V4 Pro 0813正式版深夜上线⭐⭐⭐⭐⭐后训练让Agent能力暴涨390%,逼近Fable 5,价格仅1/57
2Grok 4.6正式发布⭐⭐⭐⭐⭐GDPVal-AA v2 1753 Elo力压GPT-5.6和Fable 5,定价竞品一半
3Qwen 3.8-2.4T-A95B首次开放Max级权重⭐⭐⭐⭐⭐2.4T参数/95B激活,阿里首次开源旗舰模型
4马斯克预言AI收入9月超越SpaceX航天主业⭐⭐⭐⭐⭐明年底AI算力10GW,年收入3000-5000亿美元
5DeepSeek Harness团队公众号正式落地⭐⭐⭐⭐崔添翼带队,对标Claude Code,开放多模型生态
6SpaceXAI推出Grok Bot⭐⭐⭐⭐数字员工,与Cursor联合开发,对标Anthropic/OpenAI
7小米MiMo-V2.5登顶OpenRouter全球榜首⭐⭐⭐⭐10.5万亿Token/周,前五全是中国模型,份额63.5%
8地方国资密集入局Token运营中心⭐⭐⭐⭐嘉兴/温州/广州三地启动,统一API+计量+结算
9聚合接口整合16家厂商免费额度⭐⭐⭐月省约17亿Token,Claude Code/Codex可直接接入
10Cerebras Q2营收增74%⭐⭐⭐但硬件收入下滑,盘后一度跌17%
11Google Pixel 11系列发布⭐⭐⭐全系涨价100美元,RAM短缺迫使旗舰"减配"
12苹果iOS 27曝光AI收费⭐⭐⭐AI摘要与iCloud+套餐挂钩,AI免费时代结束
13特斯拉CyberCab首配星链系统⭐⭐⭐马斯克称AI智能体流量五年达人类千倍

二、三大事件深度拆解

2.1 DeepSeek V4 Pro 0813:后训练范式的胜利

事件:8月13日凌晨,DeepSeek官网API文档悄然更新,deepseek-v4-pro版本号从预览版切换至DeepSeek-V4-Pro-0813。没有发布会,没有官方博客,只有一行API文档的更新。

核心技术数据

评测项Preview → 0813涨幅
DeepSWE12.8 → 62.7+390%
DSBench-Hard31.1 → 67.2+116%
AutomationBench12.8 → 31.8+148%
CyberGym52.7 → 83.3+58%
Terminal Bench 2.172.1 → 87.9+22%

关键事实

  • 架构不变(862B/49B MoE),上下文不变(1M token),API接口不变——所有提升来自后训练
  • 全面超越Claude Opus 4.8,多项指标逼近甚至反超Claude Fable 5
  • 价格$0.435/$0.87(Fable 5的1/57),暂未涨价但已预告峰谷定价
  • CoT输出变成"压缩式山顶洞语",优先Coding场景
  • 迁移成本为零:模型名不变,API完全兼容

→ 详见今日专文:DeepSeek V4 Pro 0813深夜突袭:后训练让Agent能力暴涨390%

2.2 Grok 4.6 + SpaceX AI战略转身:马斯克的全栈野心

事件:8月12日美东时间,SpaceXAI正式发布Grok 4.6;同日马斯克在SpaceX全员会上预言AI收入9月超越航天主业。

Grok 4.6核心数据

评测Grok 4.6对比
GDPVal-AA v21753 Elo> GPT-5.6(1728) > Fable 5(1741)
AA Intelligence Index61并列全球第三(与GPT-5.6 Sol Max持平)
DeepSWE v1.165.9%+11.9pp vs Grok 4.5
APEX-Agents57.5%略超GPT-5.6(56.7%)
  • 定价$2/$6,约为其他前沿模型一半
  • 已进入Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare
  • 成本效率:完成AA-Briefcase仅需53轮/5亿Token(Opus 5需103轮/20亿Token)

马斯克AI时间表

时间预测
2026年9月AI收入超越SpaceX所有其他业务
明年底AI算力达10GW,年收入3000-5000亿美元
五年后AI占SpaceX价值99%

Grok Bot:与Cursor联合开发的AI代理产品,定位"永远在线的数字员工",拥有独立云端计算机,跨应用工作。

2.3 Qwen 3.8 Max开源 + 小米登顶:中国开源模型的全球统治

Qwen 3.8-2.4T-A95B

  • 首次开放Max级权重,2.4T参数/95B激活/262K上下文
  • Unsloth AI压缩至397GB(缩减91%),≥410GB内存可本地运行
  • 后训练三环节:扩展真实环境→统一奖励系统→在线数据均衡器
  • 大型商用客户可能引入分成机制

OpenRouter周榜(前五全中国):

排名模型厂商调用量
1MiMo-V2.5小米10.5万亿
2V4 FlashDeepSeek6.37万亿
3Hy3腾讯3.94万亿
4GLM-5.2智谱3.29万亿
5V4 ProDeepSeek3.17万亿

中国模型份额63.5%,美国35.5%。OpenRouter近半数用户来自美国——这是海外开发者用真金白银投出来的。


三、DeepSeek Harness前瞻:Agent竞争的下一个战场

3.1 Harness是什么?

Model + Harness = Agent │ │ │ │ │ └─ 自主执行任务的智能体 │ └─ 模型之外的全部工程工作 └─ 理解需求、推理、生成方案

Harness负责:任务拆解、上下文管理、工具调度、终端执行、错误重试、结果闭环。2026年最知名的两款Harness为OpenAI Codex和Anthropic Claude Code。

3.2 DeepSeek Harness团队

维度详情
立项2026年5月
负责人崔添翼(浙大计算机系,Jane Street九年量化背景)
公众号"DeepSeek Harness团队"已注册(深度求索北京分公司认证)
内测8月2日面向全球征集,优先Agent Harness开源项目经验者
组织与模型团队独立运作

3.3 差异化优势

维度DeepSeek HarnessClaude Code
模型接入开放多模型仅限官方Claude模型
安全合规国产自研无后门被工信部确认存在安全后门(2.1.91-2.1.196)
单次成本约$0.028较高
生态策略开放共建封闭

3.4 市场规模

  • 东方证券:2026年全球智能体代码市场约80亿美元,CR4达86%,远期中美总潜在市场4000亿美元
  • Anthropic Claude Code年化收入已达25亿美元(占Anthropic整体收入约18%)
  • 海通国际:模型竞争从参数规模转向后训练与系统工程

3.5 V4-Flash API文档中的关键线索

DeepSeek V4-Flash正式版API文档中明确写道:

“对于公开基准测试中的Code Agent任务,正式版使用**DeepSeek Harness极简模式(即将发布)**作为框架进行测试。”

这意味着Harness的"极简模式"已经存在并用于评测,完整版发布只是时间问题。


四、8月第三周关键节点前瞻

日期事件重要度关注点
8/15⚠️ Google Cloud Next 2026⭐⭐⭐⭐⭐Gemini 3.5 Pro预览?OpenAI Astra演示?
8/15⚠️ Kimi G轮500亿美元打款截止⭐⭐⭐⭐⭐Pre-IPO最后窗口,影响月之暗面估值
8/192026世界机器人大会(北京)⭐⭐⭐⭐2000+款新品,宇树/Optimus
8/21前⚠️ Grok 4.7发布⭐⭐⭐⭐2.1T参数,后训练+扩参混合策略
8/26⚠️ OpenAI Assistants API关闭⭐⭐⭐⭐⭐开发者硬截止,需迁移至Responses API
8/31Hy3 WorkBuddy免费期截止⭐⭐⭐Anthropic MCP完整支持截止
9-10月Anthropic IPO窗口⭐⭐⭐⭐⭐估值9650亿美元/ARR 470亿美元

本周最值得关注的三个节点

  1. 8/15 Google Cloud Next:Gemini 3.5 Pro是否发布?是否演示Astra?这将决定Google在前沿模型竞赛中的位置
  2. 8/15 Kimi G轮截止:500亿美元Pre-IPO打款截止,月之暗面能否完成融资将影响国产模型估值锚
  3. 8/21前 Grok 4.7:2.1T参数,Gavin Baker预计将纳入Cursor和SpaceX数据预训练——如果成真,马斯克的"数据飞轮"将形成闭环

五、今日三大趋势判断

5.1 后训练范式全面确立

Grok 4.6(更长补充训练+RL强化)、DeepSeek V4 Pro 0813(架构不变+后训练跃迁)、Qwen 3.8 Max(后训练三环节)——三款同夜发布的模型不约而同选择了"后训练优化"而非"扩大参数"。Scaling Law的边际递减已成行业共识,后训练(RLHF+工具数据+Agent轨迹+奖励工程)成为新的竞争维度。

5.2 竞争从"模型层"下沉至"框架层"

DeepSeek Harness即将亮相、Grok Bot对标Claude Code、Qwen 3.8 Max后训练中Harness成为独立训练维度——Agent竞争正从"谁的模型更强"下沉至"谁的运行框架更高效"。同一模型在不同Harness下表现可差出53个百分点。

5.3 中国AI的"三路并进"格局形成

路线代表核心优势
极致性价比DeepSeek V4 Pro 0813价格1/57,后训练跃迁
顶级开源Qwen 3.8 Max2.4T开放权重,多模态
生态+入口小米MiMo-V2.5600亿投入,人车家全场景
旗舰闭源Kimi K3 / Grok 4.6前沿能力+长程Agent

中国模型在OpenRouter份额63.5%,前五全是中国——这不是跑分,是全球开发者真金白银的投票。


六、开发者行动清单

即时行动

  • 今日:将deepseek-v4-pro接入Codex/Claude Code,实测Agent能力变化
  • 今日:测试Grok 4.6 API($2/$6),对比与现有模型的成本效率
  • 今日:下载Qwen 3.8-2.4T-A95B权重(或使用Unsloth AI压缩版397GB)
  • 今日:关注DeepSeek Harness公众号,申请内测

本周行动

  • 8/15前:制定Google Cloud Next跟踪计划(Gemini 3.5 Pro / Astra)
  • 8/15前:评估Kimi G轮截止对供应链的影响
  • 本周:测试16家聚合免费额度接口,评估对API成本的影响
  • 本周:评估地方Token运营中心(嘉兴/温州/广州)能否降低企业AI调用成本

8/26前硬截止

  • ⚠️完成Assistants API → Responses API迁移(硬截止8/26,未迁移将服务中断)

8/21前准备

  • 准备Grok 4.7测试环境(2.1T,预计纳入Cursor+SpaceX数据预训练)
  • 评估Grok 4.7对现有Agent pipeline的成本影响

七、中国AI出海与竞争观察

7.1 价格战进入"最后窗口期"

模型输入/输出定价策略
小米MiMo-V2.5$0.14/$0.29永久降价99%
DeepSeek V4 Flash$0.145/$0.29暂不涨价,预告峰谷翻倍
DeepSeek V4 Pro 0813$0.435/$0.87暂不涨价,预告峰谷翻倍
Grok 4.6$2/$6竞品一半
Qwen 3.8 Max$2/$6同Grok
Claude Fable 5$10/$50前沿溢价

DeepSeek预告涨价、Grok定价竞品一半、小米永久降价99%——三种定价策略反映三种商业模式:DeepSeek从"以价换量"转向"价值锚定",Grok用低价抢Agent入口,小米用极端低价换生态渗透。

7.2 安全合规成替代窗口

Claude Code被工信部确认存在安全后门(2.1.91-2.1.196版本),阿里/腾讯/美团/京东已排查管控。DeepSeek Harness以"国产自研无后门"为差异化,恰逢替代窗口期。

7.3 地方国资成为AI基础设施新角色

城投公司从"大拆大建"转向"Token运营",打破算力孤岛、降低AI门槛。温州的"绿色Token"(碳足迹凭证)可能成为外贸企业出海的差异化合规工具。


八、风险警示

8.1 DeepSeek涨价风险

DeepSeek已明确预告"近期整体上调API服务定价,预计涨幅较大"。高峰时段(9-12/14-18)价格直接翻倍。当前低成本窗口可能随时关闭,基于DeepSeek低价构建的应用需做好成本弹性规划。

8.2 前沿模型评测可信度风险

三款同夜发布的模型都在各自公布的评测中"领先"——Grok 4.6称GDPVal-AA v2第一,DeepSeek称多项超越Fable 5,Qwen称"除了Fable 5外最强大"。第三方独立评测尚未完成,跑分"没输过"与实际体验"没赢过"的差距仍需警惕。

8.3 SpaceX AI预测兑现风险

马斯克的预测时间表(9月AI收入超航天、明年底10GW算力)极为激进。SpaceX作为非上市公司,AI收入数据无法独立验证。"五年后AI占SpaceX价值99%"的判断更接近愿景而非预测。


FAQ

Q1:8月13日发布的三款模型,哪款最适合企业部署?

  • 预算敏感+编程Agent:DeepSeek V4 Pro 0813($0.435/$0.87,零迁移成本)
  • 需多模态+可本地部署:Qwen 3.8 Max(2.4T开源,Unsloth压缩版397GB可跑)
  • Cursor生态+长程Agent:Grok 4.6($2/$6,GDPVal-AA v2第一)
  • 极低成本独立开发:小米MiMo-V2.5($0.14/$0.29,全模态开源)

Q2:DeepSeek Harness什么时候能用到?

公众号已注册,8月2日开始内测招募。V4-Flash API文档提到"极简模式即将发布"。预计数天至数月内正式亮相。可关注"DeepSeek Harness团队"公众号获取最新动态。

Q3:马斯克说AI收入9月超越航天,对开发者有什么影响?

如果SpaceX的AI算力扩张(10GW目标)和星链带宽基础设施兑现,开发者可能获得更便宜的推理算力和更稳定的全球网络接入。Grok Bot如果开放,将提供Claude Code/Codex之外的第三个主流Agent框架选择。

Q4:地方Token运营中心值得企业接入吗?

值得评估。统一API入口可调用100+模型,不必自行配环境。政府补贴可直接抵扣。但需注意:数据安全审计要求、是否有供应商锁定风险、模型选择是否受限。


参考资料

  1. 华尔街见闻 (2026-08-13):《DeepSeek V4 Pro正式版深夜"突袭"》
  2. 华尔街见闻 (2026-08-13):《SpaceXAI新"杀器":Grok 4.6智能体测试力压GPT-5.6、Fable 5》
  3. 华尔街见闻 (2026-08-13):《华尔街见闻早餐FM-Radio 2026年8月13日》
  4. 科创板日报 (2026-08-13):《DeepSeek V4 Pro正式版来了!尚未公布调价方案》
  5. 阿里魔搭社区 (2026-08-12):Qwen3.8-2.4T-A95B开源公告
  6. 36氪/智东西 (2026-08-13):《阿里开源2.4万亿参数大模型》
  7. 网易科技 (2026-08-13):《DeepSeek的智能体工具团队来了》
  8. 新浪科技 (2026-08-02):《雷军回应小米大模型登顶全球》
  9. 雪球 (2026-08):《小米MiMo-V2.5登顶OpenRouter》
  10. 南方周末 (2026-08-13):《城投也下场,地方国资押注Token万亿新赛道》
  11. QQ新闻 (2026-08-13):《AI智能体信息日报》/《马斯克AI早报》
  12. 科创板日报 (2026-08-12):马斯克SpaceX全员会
  13. ai-bot.cn (2026-08):《DeepSeek Harness》
  14. 每日经济新闻 (2026-08-13):《全球科技早参》
  15. 格隆汇 (2026-08-13):《阿里巴巴拟开源Qwen3.8-Max,或引入分成机制》

← 返回列表