DeepSeek-V4-Flash正式版来袭,真的掀桌了!完成一篇完整的学术文章只要……

📅 2026/8/4 8:13:36 👁️ 阅读次数 📝 编程学习
DeepSeek-V4-Flash正式版来袭,真的掀桌了!完成一篇完整的学术文章只要……

一、近期国内模型井喷:新模型扎堆发布 🚀

最近半个月国内大模型圈炸了。Kimi K3、Qwen3.8-Max-Preview、DeepSeek-V4-Flash正式版接连上线。参数规模全面进入万亿时代,而且每一个都在自己的赛道上放了大招。更戏剧性的是,就在国产模型密集发布的同时,海外OpenAI的GPT-5.6-Luna突然官宣降价80%——一场关于"智价比"的中外对决,正式开场。

🔥 Kimi K3 ——开源最强模型

月之暗面在7月16日发布Kimi-K3,7月27日正式开源完整权重。这货的参数量直接拉到2.8万亿(MoE架构,激活1040亿),支持原生视觉理解和100万Token上下文窗口。

💡核心亮点:KDA混合线性注意力 + 注意力残差技术,把超长文本的计算量从平方级降到接近线性级。Frontend Code Arena以1679分登顶,超过Claude Fable 5和GPT-5.6 Sol——开源模型首次在该榜单超越所有闭源模型

API定价:缓存命中¥2/MTok,输入¥20/MTok,输出¥100/MTok。Hugging Face上开源30分钟内点赞破4000,近3700名开发者蹲守下载。

⚡ Qwen3.8-Max-Preview —— "依然自称是除Fable 5外最强"

阿里通义千问在7月19日推出Qwen3.8-Max-Preview。2.4万亿参数,第三代MoE架构,原生多模态,百万Token上下文。官方自评很克制——中文稿加了"可能"二字,英文稿直接去掉了😂。预览阶段采用"天更迭代"模式,能力每天都在变。但最狠的是价格策略。。。Qoder免费用户会给300积分,这0.01x的倍率可以爽用!

▲ Qwen3.8-Max-Preview : 常规时段0.05x(1折) → 夜间22:00-08:00仅0.01x(0.2折)

⚠️划重点:常规时段1折,夜间0.2折!这意味着调用一个2.4万亿参数的旗舰模型,成本比很多"轻量模型"还低。代码能力较前代+22.8%,协同办公+44.4%。各平台模型倍率对比一览:

▲ Qoder平台模型倍率:Qwen3.8-Max-Preview仅0.01x(几乎免费),DeepSeek-V4-Flash 0.1x

💎 DeepSeek-V4-Flash正式版 —— 后训练的魔法

小蓝鲸在7月31日悄咪咪地上线了V4-Flash正式版API公测。总参数2840亿,激活仅130亿——但成绩单亮瞎眼:

基准测试

得分

Terminal Bench 2.1

82.7

Cybergym(网络安全攻防)

76.7

DSBench-FullStack

68.7

Toolathlon Verified

70.3

DSBench-Hard

59.6

更离谱的是:模型结构完全没改,只是重新做了后训练。同样的2840亿参数骨架,纯靠训练策略优化就把Agent能力拉到了接近自家Pro版的水平。Artificial Analysis智能指数给到50分——仅比GPT-5.6 Luna(51分)低1分。成本呢?输出定价$0.28/百万token,加上98%缓存命中折扣,单任务成本比GPT-5.6 Luna低约60%

总结:DeepSeek用不到竞品一半的钱,跑出了接近顶尖闭源模型的Agent能力。这不是"性价比高",这是直接把桌子掀了。

🌙 GPT-5.6-Luna —— 突然大降价80%的"闭源性价比之王"

说到"竞品",就不得不提OpenAI的GPT-5.6-Luna。它是GPT-5.6系列中最快、最便宜的模型,支持工具调用和多步Agent工作流,已经是Replit、Cognition、Ramp等公司的默认选型,被OpenAI自己称作"最接近'便宜到不用计量'的智能"。

关键转折在7月30日——GPT-5.6系列发布仅三周,OpenAI突然宣布Luna价格直降80%

计费项

降价前

降价后

降幅

输入 / 百万Token

$1.00

$0.20

-80%

输出 / 百万Token

$6.00

$1.20

-80%

降价后,Luna的Artificial Analysis智能指数仍是51分——注意,这个分只比DeepSeek-V4-Flash的50分高1分

💡智价比(Intelligence-per-Yuan)时刻到了:

每百万 token

V4-Flash

GPT-5.6 Luna

输入(牌价)

$0.14

$0.20

输入(DeepSeek 高峰 2x 后)

$0.28

$0.20

输出

$0.28

$1.20

输入端,Luna 降价后仍比 Flash 牌价贵约 43%,只有打到 DeepSeek 高峰价才反超——36氪那句"Luna 输入价比 DeepSeek 还便宜"指的正是高峰场景。输出端才是长文场景的大头,Flash $0.28 对 Luna $1.20,便宜 77%。按一篇 2.8 万字论文全流程(检索+写作+绘图+排版+验收)约消耗输入 300 万 token、输出 50 万 token 估算:Flash 约$0.56(≈¥4),Luna 约$1.2(≈¥8.6)——都不到一杯奶茶,但 Flash 再省一半。智价比这张桌子,DeepSeek 确实是亲手掀的。


二、学术写作实测:五个模型同题PK 📝

光看跑分不够。我们做了一个更硬核的测试:同一篇学术论文生成任务,并行交给5个模型执行,看看谁产出的内容最完善。

🎯 测试任务说明

每个模型需要独立完成以下全套交付物:

  • 能力报告(capability report)

  • 研究契约(research contract)

  • 文献检索日志(search log)

  • 证据矩阵 + references.bib(≥30条真实文献)

  • 引用审计报告(reference audit)

  • 详细大纲(outline)+ 论证地图(argument map)

  • 逐章写作(7章正文)

  • 前端图表生成(SVG+PNG)

  • 数据表格(table-data-and-sources.md)

  • 全文整合 + 引用审计 + 同行评审

  • final-paper.docx / .tex / .pdf 三格式输出

  • 格式验证 + 最终QA报告

被测模型:5.6-luna/opus-5/ds4-flash(DeepSeek-V4-Flash) /qoder-qwen-3.8/workbuddy-k3

📊 执行过程实拍

以下是Qoder平台使用Qwen3.8-Max-Preview执行论文生成的完整过程截图:

▲ 任务启动:从环境检查到最终QA共20+步骤自动规划

▲ 执行中:大部分子任务已完成✅,进入深度思考模式处理复杂章节

▲ 收尾阶段:PDF已生成(22页/358KB),正在进行格式验证

🏆 六维打分结果

我们从任务完成度、内容细节、图文丰富度、文献真实度、AIGC指纹五个维度量化评分(综合得分按权重加权),结果如下:

维度

5.6-luna

opus-5 ⭐

ds4-flash

qoder-3.8

workbuddy-k3

任务完成度(文件数)

141

75

66

46

99

内容细节(词数)

21.0k

47.8k

27.1k

13.0k

18.8k

图文丰富度(图+交互页)

54

51

36

24

37

文献真实度(Bib条目)

34

34

41

34

40

综合得分

73.3

86.8 🥇

76.7

55.5

72.2

🔍 关键发现

  • opus-5 综合登顶(86.8分)

    opus依然是那个最强模型:47.8k字正文 + 51张配图,内容深度碾压全场。如果你要的是"一篇有血有肉的完整论文",opus依然是最强的。但是opus不便宜。看看opus的作图能力。绝对的Sota!碾压其他模型。

  • 5.6-luna 紧随其后(73.3分)

    交付物最全(141个文件),适合追求"什么都要有"的场景。但是看看这图片质量完全不是一个级别的。可以说拉完了。图片这一块真的要降不少分。

  • DeepSeek-V4-Flash(ds4-flash,76.7分)

    整体得分已经非常给力了,文献质量最高(41条真实引用,全部可溯源)。考虑到它的成本只有顶级模型的一半左右,这个性价比已经非常能打了。综合表现绝对夯!而且最终开销仅为1.38元。pro是其他任务消耗无视即可。

DeepSeek-V4-Flash 论文技术页面:系统结构、业务逻辑与图文解释结合

  • Kimi-K3的表现中规中矩:文献核验与长任务推进扎实,但存在空白页、1 处 XML 错误、文件哈希不一致,部分图尺寸偏小,交付稳定性拖累总分。而且kimi-K3的定价并不便宜,无论是订阅还是在workbuddy里使用积分,消耗都非常快。。
  • Qwen-3.8-preview一言难尽:虽然整体内容表现不俗,但是无法生成word,这个是非常致命的。主要问题不是字数,而是交付链断裂:图片未进入成品、正文与文献无法匹配、编号和元数据重复。它最能说明,调用便宜不等于返工便宜。

三、参考基准:千笔AIWritePaper学术写作平台分析 📋

这几份模型论文都参考了千笔AIWritePaper学术写作平台中的同题原稿。

千笔写作原稿页面顶部:摘要、目录与 17,602 字页面标注

千笔写作原稿中的需求表与研究框架图:视觉完成度较高

千笔-AIWritePaper原稿多维评分

维度

得分

说明

结构完整度

90

章节与论文要素齐全

内容细节

76

技术描述多,部分结论泛化

图表丰富度

92

21 图、11 表,表面完成度高

文献真实性

78

抽样文献可查,来源等级不一

AI率

85

自研模型适配各大平台

写作自然度

52

学术风格、专业性较强

综合

86

接近终稿,还需一定调整

📌 千笔AIWritePaper学术写作是什么?

千笔AIWritePaper学术写作定位为"AI论文写作与降AI、降重平台",核心卖点如下:

能力维度

千笔-AIWritePaper学术写作

产出速度

10分钟产出3万字

内容类型

真实网络数据、图、表、公式、代码

大纲能力

不限次2000字3级大纲

参考文献

40篇真实参考文献

质量承诺

AI率、重复率不达标就退费

⚖️ 千笔AIWritePaper学术写作 vs Agent自主执行模式

两种模式的区别:

对比项

AIWritePaper(一站式工厂)

各家Agent(本次测试)

使用门槛

极低(零基础可用)

中等(需基本操作能力)

可控性

无限改稿(结果生成后改稿)

全透明(每步可审查干预)

内容深度

★★★★★

★★★~★★★★★(opus-5)

降AI

强(有自研降AI模型)

一般(需不断调整skill)

成本

按需计价

与模型价格有关deepseek可能只要1元、opus可能需要十几$

📊 综合评分

评分项

千笔AIWritePaper学术写作

Agent模式(opus-5)

便利性

★★★★★

★★★☆☆

可控性

★★★★☆

★★★☆☆

内容深度

★★★★★

★★★☆☆

性价比

★★★★

★ (claude-opus-5)

★★ (kimi-K3)

★★★★(gpt-5.6-luna)

★★★★★(deepseek)

总分

4.6 / 5.0🏆

3.0 / 5.0 🏆

💡结论:如果你是零基础用户、赶时间交作业,千笔AIWritePaper是最好选择。但如果你对论文质量有要求、希望全程可控、且在意成本——Agent自主执行模式成本可能更低,但需要不断迭代,并且对整个流程非常熟悉,而且不同模型很可能质量参差不齐,作为初稿写作可能比较合适。opus-5产出的47.8k字+34张图+真实文献,确实非常给力,但是考虑到成本,你愿意花跟千笔AIWritePaper差不多的价格买到一篇只是质量稍强一点的初稿吗?


四、结论:掀桌的不是某一个模型 💡

回到标题的问题:完成一篇完整的学术文章只要……?

根据我们的实测数据,答案取决于你的选择:

  • DeepSeek-V4-Flash(夜间0.2折调用)→ 成本可能低至几块钱,质量中上(66.7分),文献最靠谱!

  • opus-5→ 质量最高(86.8分),47.8k字+51张图,适合追求完美的场景!

  • 用 kimi-K3 → 各项

  • 5.6-luna→ 交付物最全(141个文件),适合"什么都想要"的用户

  • 千笔AIWritePaper学术写作→ 零门槛,10分钟出活,最全能,后顾无忧!

🎯 四点核心判断

第一,2026年7月是国内大模型的"井喷月"。

Kimi K3(2.8T开源)、Qwen3.8(2.4T预览)、DeepSeek-V4-Flash(284B激活13B)接连发布,参数规模全面进入万亿时代。国产前沿模型与国际SOTA之间的差距正在快速缩小。

第二,DeepSeek-V4-Flash正式版的真正意义不在参数规模。

它证明了"后训练杠杆效应"——同样的模型骨架,纯靠训练策略优化就能实现Agent能力的质变。2840亿总参数/130亿激活参数,这个"小身材"跑出了不输GPT-5.6 Luna的成绩,而成本更低。这意味着:堆参数不再是唯一的出路

第三,Agent自主执行模式已经可以产出专业级论文。

opus-5的86.8分不是靠"量大"取胜——它的47.8k字是有结构的、有论证逻辑的、有真实文献支撑的完整学术文本。加上每一步都可审查、可干预、可迭代,这种模式已经从"能用"进化到了"好用"。贵有贵的道理。使用门槛也极高(封号非常严重,A÷不当人)。

第四,成本曲线正在重塑整个行业。

当一篇完整学术论文的生成成本降到几块钱以内时,讨论"AI会不会取代学术写作"已经没有意义了——真正的问题是:你准备好用AI来放大自己的能力了吗?