【AI】技术日报 | 2026 年 7 月 28 日

📅 2026/7/29 13:57:48 👁️ 阅读次数 📝 编程学习
【AI】技术日报 | 2026 年 7 月 28 日

AI 技术日报| 2026 年 7 月 28 日
聚焦国产大模型与底层算力,带你看懂本轮中国 AI 竞速的技术细节。

引言

刚刚过去的这段时间,可以说是国产大模型的"密集轰炸期"。从阿里千问 Qwen 3.8 系列的正式亮相,到 DeepSeek V4 全面开放,再到智谱 GLM 系列的持续迭代,加上阿里云自研 AI 芯片"真武 M890"超节点在 WAIC 上正式发布——国产 AI 正在从"追赶"逐步转向"并跑",甚至在开源权重(open-weight)赛道上已经建立起明显优势。

本期日报挑选了几条偏技术方向、且以国内大厂为核心的重点新闻,逐条拆解其技术细节,供各位开发者参考。


一、阿里千问 Qwen 3.8 Max:2.4 万亿参数 MoE 预览版登场

7 月 19 日,阿里正式推出旗舰模型Qwen 3.8 Max(预览版)。这也是今年夏天参数规模最大的一次模型发布之一。

核心技术要点:

  • 架构:稀疏专家混合(Sparse Mixture-of-Experts, MoE),总参数量高达2.4 万亿(2.4T),通过稀疏激活在推理时只调用一部分专家网络,从而在保证能力的同时控制推理成本。
  • 多模态:原生支持多模态输入。
  • 定位:官方宣称其综合能力在全球范围内仅次于第一梯队的头部闭源模型,位居前列(需注意:预览版发布时官方尚未公布完整的 benchmark 成绩,这一说法有待第三方评测验证)。
  • 可用性:目前可通过阿里的 Token Plan 订阅方案接入使用。

除了 Max 版本,阿里在开源权重线上依然保持节奏——此前发布的Qwen3.6-27B(2026 年 4 月 22 日)仍是当前最新的开源通用 Qwen 模型,兼顾了本地部署的可行性与能力。

点评:Qwen 3.8 Max 走的是"大参数 + MoE 稀疏激活"的典型路线,与 DeepSeek V4 的思路一致。这条路线的价值在于:用超大参数堆能力上限,再用稀疏激活把实际推理算力压下来。对开发者而言,真正值得关注的是它的每 token 激活参数量API 定价,这两个指标直接决定了落地成本。


二、DeepSeek V4 全面开放:1.6 万亿参数、百万上下文、MIT 开源

DeepSeek 在 4 月 24 日发布 V4 预览版后,近期正式转为全面可用(GA)。这是本轮国产模型竞赛中最受关注的开源发布之一。

核心技术要点:

  • 双模型策略
    • V4-Pro:总参数1.6 万亿(1.6T),每 token 激活约49B
    • V4-Flash:总参数284B,主打轻量与高性价比。
  • 超长上下文:通过 API 提供100 万(1M)token上下文窗口,配合其"Lightning Index / Lookahead Sparse Attention"稀疏注意力机制,可将长上下文场景下的 KV Cache 显存占用压缩到全量的约13.5%,这是长文本推理落地的关键优化。
  • 混合注意力架构:采用 hybrid attention 设计,兼顾短序列的精度与长序列的效率。
  • 开源协议:两个模型均以MIT 许可证开放权重,商用友好。
  • API 定价(参考):V4-Pro 约 $0.435 / 1M 输入 tokens、$0.87 / 1M 输出 tokens;V4-Flash 约 $0.14 / $0.28,命中缓存的输入价格可低至 $0.0028 级别。

点评:DeepSeek 依旧延续了"极致工程 + 开源普惠"的打法。V4 最大的技术看点不是参数规模,而是长上下文的显存压缩——把 1M token 的 KV Cache 压到 13.5%,意味着长文档、大型代码库分析这类场景的部署成本被大幅拉低。对做 Agent、RAG、代码工具的开发者,这是实打实的利好。


三、阿里云"灵骏真武 M890"超节点:单台承载十万亿参数级 MoE 推理

2026 世界人工智能大会(WAIC)上,阿里云正式发布灵骏真武 M890 超节点实例,并在内蒙古乌兰察布地域开放邀测。这是阿里云首次通过公共云对外提供超节点形态的 AI 算力服务,意义重大。

核心技术要点:

  • 自研芯片:搭载平头哥新一代训推一体 AI 芯片真武 M890,内建144GB 显存,片间互联带宽800GB/s,官方称性能达到上一代真武 810E 的3 倍
  • 超节点规模:单个超节点通过ICN Switch 1.0互联芯片将64 张真武 M890高速互联,整机显存规模达到约9TB
  • 承载能力:单台超节点可承载十万亿参数级(10T+)的 MoE 大模型推理。
  • 生态适配:7 月 23 日,阿里云宣布真武 M890 超节点已成功适配最新旗舰模型Qwen3.8,并已在百炼(BaiLian)平台上提供推理服务,形成了"自研芯片 + 自研模型 + 云平台"的完整闭环。

点评:这条新闻的分量不亚于任何一次模型发布。当模型规模冲向万亿、十万亿参数级别,算力底座就成了决定性因素。阿里云用自研芯片打通"训推一体 + 超节点 + 公共云"的完整链路,既是对英伟达生态的正面回应,也让国产超大模型有了不依赖进口高端芯片的推理落地路径。芯片、模型、云三位一体,这才是大厂真正的护城河。


四、字节跳动 Seedance 2.5:单次生成 30 秒原生 4K 视频

字节跳动在火山引擎 FORCE 大会上发布的视频生成大模型Seedance 2.5,已于 7 月 16 日通过 BytePlus 国际云平台正式开放 API。

核心技术要点:

  • 单次 30 秒长视频:最大亮点在于可以在单次推理中一次性生成长达30 秒的连续视频,无需分段拼接(no stitching)。此前多数竞品的单次生成上限普遍在 8~15 秒,需要靠多段拼接延长,且容易出现前后不一致。
  • 原生 4K + 同步音频:直出原生 4K 分辨率,并且画面与音频同步生成
  • 全模态多参考输入:支持最多50 个多模态素材作为参考输入,配合3D 摄像机走位(camera blockout)控制,大幅提升了对镜头语言的可控性。
  • 落地场景:一次成型的长镜头能力,改变了广告、短视频、影视预演等场景的制作流程。

点评:视频生成的核心矛盾一直是"时长 vs 一致性"。Seedance 2.5 用单次推理直出 30 秒,本质上是在时序一致性建模上做了突破——不靠拼接就意味着人物、场景、光影在整段视频里能保持连贯。需要提醒的是:多家媒体也指出,这类超长视频在版权归属上仍存在未解风险,商用时需谨慎评估素材来源。


五、行业观察:国产开源大模型的"组团突围"

除了上述几条重点,本轮竞速还有几个值得关注的信号:

  • 智谱 GLM 系列持续迭代:GLM-5(约 744B 总参数、40B 激活的 MoE)是目前中国生态中较强的开源权重模型之一;据多方消息,下一代基础模型GLM-5.5预计将在 8 月左右发布,市场对其能否进一步逼近全球头部模型抱有期待。
  • 月之暗面 Kimi K3:作为新一代国产开源权重模型发布,参数规模据称达到 2.5 万亿级别,正在推动大量企业级 AI 应用转向开源权重路线。
  • 一个共同趋势:国产大厂在开源权重赛道上正形成合力。开源 + 低价 API + 自研算力,这套组合拳正在重塑全球 AI 的供给格局。

总结

把这几条新闻串起来看,本轮国产 AI 竞速呈现出三条清晰的技术主线:

  1. 参数规模持续冲高,但靠 MoE 稀疏激活控成本——Qwen 3.8 Max(2.4T)、DeepSeek V4-Pro(1.6T)都是典型。
  2. 长上下文与显存优化成为工程竞争焦点——DeepSeek V4 把 1M token 的 KV Cache 压到 13.5% 是标志性突破。
  3. 算力底座国产化提速——阿里云真武 M890 超节点打通了"自研芯片 + 自研模型 + 云"的完整闭环。

对开发者而言,最实际的建议是:关注每 token 激活参数量、上下文成本和 API 定价,而不是只看总参数这个"面子指标"。真正决定能否落地的,永远是性价比。


本文由自动化资讯助手整理编译,内容基于公开网络信息,部分数据(如参数量、定价、benchmark)以官方最终发布为准,请以一手信源为准。

参考来源:

  • Alibaba’s Qwen3.8-Max Claims Second Place — TechTimes
  • Qwen 3.8-Max: Release Date, Specs — YottaLabs
  • DeepSeek V4 GA Architecture — Hugging Face Blog
  • DeepSeek-V4-Pro-NVFP4 — Hugging Face
  • Lightning Index Ultra-Long Context — arXiv
  • 阿里云发布灵骏真武 M890 超节点实例 — linux.do
  • Alibaba Cloud Launches Lingjun Zhenwu M890 — Longbridge
  • ByteDance Seedance 2.5 API Goes Live — CineD
  • GLM-5 Guide — aicybr
  • GLM-5.5 Release Rumors — felloai