三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

GPT-5.4 mini+nano突袭,1/3价格养满血「龙虾」!OpenAI彻底杀疯

GPT-5.4 mini+nano突袭,1/3价格养满血「龙虾」!OpenAI彻底杀疯

一声不吭,又扔了一颗炸弹。

今天, GPT - 5.4 mini正式发布, 与此同时, GPT - 5.4 nano正式发布。

没有预热,没有倒计时,直接上线。

明确的是, 这两个模型所针对要解决的问题, 是在真实的生产环境当中, 如何促使 AI 能够以较快的速度、较为准确的程度以及相对便宜的成本去开展工作?

它们承袭了GPT - 5.4那核心方面的优势, 速度推进到最高限度, 成本呈现出更低的状况, 称得上是轻量级模型极致的佳作成果。

先说最炸裂的数字——

对于编码而言, 也就是SWE - Bench Pro测试中, GPT - 5.4 mini所获得的比例是54.4%, 然而那满血版本的GPT - 5.4获取的比例则是57.7%。

计算机使用情况如下, GPT - 5.4 mini取得了72.1%的成绩, 该成绩能够与GPT - 5.4(75%)相媲美。

另外, 在推理任务当中, mini的实力直接逼近GPT-5.4, 在工具调用任务当中, mini的实力也直接逼近GPT-5.4。

并且, 与前一代GPT - 5 mini相比较而言, GPT - 5.4 mini的运行速度一下子就提升了, 达到了原来的2倍!

网友坦率, 表示Mini以及Nano绝对能够当作「那个类似钳子样的节肢动物」的主要模型来搞!

GPT-5.4 mini具备400k的超大上下文, 其输入价格为每百万token 0.75美元, 输出价格是每百万token 4.5美元。

GPT - 5.4 nano, 其输入价格为每百万token是0.2美元, 而输出价格是每百万token达1.25美元。

和GPT - 5.4相比, mini的输出价格展现为其三者之一这个数值, 并且nano的价格呈现为仅为其中的十二分之一这般的态势组成。

如今,快、强、便宜,三个词同时成立了。

而在半年之前,这是完全不可能的。

试用过后, 有人惊叹, 居然异常香!速度不仅快, 而且在价格上, 相比于4.6 Opus, 便宜达9倍之多。

代码恐怖进化

mini追平「满血」,nano吊打前代

先看编码。

SWE - Bench Pro是当下用以衡量大模型“真实编码能力”的极为硬核的基准当中的一个, 它不考填空题, 而是要让模型直接去修复实际存在的真实软件Bug。

GPT - 5.4 mini取得54.4%的成绩, 距离满血版GPT - 5.4的57.7%, 仅仅相差3.3%。

这表明, 有一个针对速度与成本所进行优化的小型模型。其在开展对于真实工程问题的解决时, 已然触及到了旗舰模型的上限。

上一代的GPT - 5 mini只是45.7% , mini到mini之间有着隔阂, 一代的间隔就产生了将近9%的飞速跨越呀。

GPT-5.4 mini拿下60.0%, 差距更显得夸张, 而GPT-5 mini仅为38.2%, 提升幅度超过57%, 这是Bench 2.0的情况。

纵使是最小型号的nano, 其在SWE - Bench Pro上的成绩达到了52.4%, 这一成绩相较于上一代的mini还要高出将近7%。

一个把定位设定为「分类和数据提取」的超轻量模型, 它的代码能力, 竟然能够碾压上一代的中量级水准选手, 而这, 便是蒸馏模型在过去几个月里所展现出的进化速度。

对开发者来说,这组数据的实际含义非常直接:

像定向代码修改、前端页面生成、调试循环、代码库检索这类, 不需要旗舰模型「满功率思考」的编码任务, 如今能够全交给mini, 其速度快出一倍, 成本降低许多, 效果几乎没有损耗。

博士级推理,复杂工具调用双杀

被编码的仅仅是单个的切面,具备推理以及工具调用的能力, 才意味着一个模型能够切实完成作业。

GPQA当属一个博士级科学推理基准, GPT - 5.4 mini获取了88% 的成绩, 和GPT - 5.这个成绩仅相差 差5% 数值。

更值得关注的是「工具调用」能力。

重点在于对模型于复杂工具链里的表现予以测试, 并非仅仅是调用一回 API, 乃是于多步骤任务当中准确无误地将多种工具进行组合、排序以及运用。

最终的情况是, GPT - 5.4 mini所获得的分数为42.9%, 它呈现出了一种完全将GPT - 5 mini(其得分为26.9%)压制超过的态势 , 是完全处于碾压状态的。

其余不说, 于电信行业规定专用基准, τ 2——bench范围内, 小型配置版本竟然成就百分之九十三点四如此极为高的分数, 差不多赶上以最高充满能力状态运行设定的版本百分之九十八点九这样的数据情形, 将有GPT——5命名小型配置版本, 百分之七十四点一这般水平远远抛在非常后面处呢。

针对另一个工具调用基准MCP Atlas, GPT-5.4 mini取得了57.7%的成绩, 然而, GPT-5 mini所获得的是47.6%。

下面这些数字, 是这样组合成为一句话的: GPT - 5.4 mini, 它并非单纯只是那种被形容为「缩小版的聪明模型」的存在, 它实际上是一个在生产环境当中, 真正能够独立去完成复杂任务链的执行者。

「龙虾」主力

小模型也能「看屏幕干活」

真正让人意外的, 是GPT - 5.4 mini, 它在计算机使用方面有着相应表现。

人使用电脑的方式是, 用眼睛去看屏幕之上所呈现的UI元素, 凭借大脑来判断应当点击何处, 随后运用手去对鼠标以及键盘进行操作。

要是AI切实想变为你的「赛博助理」, 那它同样需掌握这样一套本领——迅速剖析一张信息繁杂的屏幕截图, 确定按钮、输入框以及数据列表的位置, 而后施行正确的操作。

-就是测这个「视觉理解+推理+操作」三位一体的综合能力的。

这张榜上, GPT - 5. 4 mini拿下了72. 1%, 旗舰版GPT - 5. 4则是75. 0%, 二者差距不到3个百分点。

与此形成对照的是, GPT - 5 mini所占比例仅为42.0% , 在一代的间隔当中, 计算机的使用能力几乎增长了一倍。

然而, 在这项测试里头, nano所获得的占比仅仅为百分之三十九点零, 甚至于还微微少于上一代GPT - 5 mini所占有的百分之四十二点零。

这表明, 计算机运用任务, 对于模型的视觉推理能力而言, 具备很高的门槛要求, 并非仅仅通过缩小模型便能够保住, mini与nano之间, 存在着一道清晰的能力断层。

于(包含工具)之上, mini获取到78.0%, 旗舰版得到81.5%, 二者之间的差距亦是非常小的。

这个基准包含了许多复杂题目, 这些题目需要把视觉信息与数学工具相结合进而展开推理, 同时还需要结合代码工具来进行推理。

这组结果对一个特定方向有重大意义:AI Agent。

当一个小模型对于信息密集的UI截图能够急速解析, 并且在低延迟状况下做出正确的操作决策, 这时候这种小模型便成为构建可实时使用的计算机的理想引擎, 成本较低, 响应速度较快且具备一定的能力。

在TBPN最新访谈中,奥特曼明确了下一步愿景:

要推出一个经过进化的Codex, 这个新版本不会再被局限于编程方面, 它将会演变成一个能够「控制计算机」的、强大的工具。

在他的设想里面, 人们能够完全借助手机去启动以及管理新的任务, 切实到来的真正终极体验是, 具备一个基于统一后端的个人专门所属的AI。

它可以去访问个人全部的数据, 以及想法、素材、记忆, 并且能够跨越多个不同的终端, 毫无缝隙地去执行任务。

子智能体范式

大模型决策,小模型执行

在此次发布当中, 耗费了诸多篇幅去阐明这样一个理念, 既最好的AI系统, 并非必然要借助最大的模型去处理全部事情。

他们提出的架构思路很清晰:

GPT - 5.4这个旗舰模型, 对于规划方面承担着职责, 在协调工作上发挥着作用, 并且要做出最终决策, 之后呢, 会将具体的任务, 分发给GPT - 5.4 mini子智能体, 让它们并行去做执行。

迷你要接下搜索代码库的工作,迷你要接下审查大型文件的工作, 迷你要接下处理支持文档的工作, 这些工作不需要深度思考, 但却需要快速完成。

在Codex中,这套架构已经落地了。

开发者能够让GPT - 5.4去确立总体方面的方案, 接着凭借它自动地去安排调度mini子智能体, 从而使mini子智能体去实行各个不同的子任务。

并且, mini于Codex里, 仅仅耗费GPT - 5.4配额的百分之三十。

也就是说,同样的预算,你可以跑三倍多的mini任务。

这种「分层调度」的思路,其实是整个AI行业正在收敛的共识。

与其去追求那种具备无所不能特性的超大模型, 倒不如去构建一个有着分工明确状况的模型协作系统。

被视为总指挥的是旗舰模型, 被当作执行团队的是mini模型, 被看作处理琐碎事务助理的是nano模型。

对开发者来说,这意味着架构设计的思路要变了。

以往的情况是, 挑选出一个最为强大的模型, 而后把所有的任务都交付给它;现如今的状况却是怎样, 依据任务的复杂程度, 进行动态的路由操作, 使其到达不同层级的模型那儿。

的CTO 给出的评价很有代表性:

在多项输出任务方面, GPT - 5.4 mini 的引用召回率颇高, 其以低得多的成本, 不仅匹敌了竞品模型, 甚至在此基础上实现了超越, 并且它还达成了相比更大模型而言更高的端到端通过率。

“更小的模型”陈述的内容, “更好的效果”所表达的情况, 在两年的时间之前, 可以说若去形容它仿若天方夜谭一般, 然而到了当下, 已然变成了工程实践过程之中实际发生的场景。

全面铺开,免费用户也能用

就在今天, GPT - 5.4 mini业已实现全线上线这一情况, 并且其API、Codex以及三端同步开放这一事实也已存在。

对于API而言, 进行定价得出, 其输入的价格在每百万Token为0.75美元, 而输出的价格则是每百万Token为4.50美元, 并且其上下文窗口的大小是400K。

具备支持文本输入的能力, 也拥有支持图像输入的能力, 还涵盖工具使用的能力, 包含函数调用的能力, 有网络搜索的能力, 存在文件搜索的能力, 以及计算机使用等全套能力。

GPT - 5.4纳米仅于API里面可用, 价钱是输入每百万Token为0.20美元, 输出每百万Token则是1.25美元。

进行一番对比, GPT - 5.4 nano的输入价格, 是mini输入价格的差不多四分之一, 而GPT - 5.4 nano的输出价格, 也比mini的输出价格少不足三分之一的量。

在面对分类任务时,在面对数据提取任务时,在面对排序这类高频但低复杂度的任务时, nano的性价比几乎无敌。

在该端, GPT - 5.4 mini已对免费用户以及Go用户予以开放, 能够借助菜单里的「」功能来进行使用。针对付费用户而言, 当GPT - 5.4的额度消耗殆尽的时候, mini会自动充当为降级的备选方案。

该策略极为精明, 能使免费用户也可体会到强大的推理能力, 在降低使用门槛之际, 还会扩大用户基盘。

而对付费用户来说,mini的存在让「额度焦虑」大大缓解。

长上下文是mini的短板

当然,mini不是没有弱点。

对于长上下文的处理方面, GPT - 5.4 mini与其旗舰版彼此之间存在差值, 此差值的显著程度相较于其他诸多维度更为突出, 展现出明显的区分态势。

64K至128K窗口的8针搜索任务里进行的MRCR v2测试, GPT-5.4得到了86.0%, mini仅为47.7%, 二者差距将近40个百分点。在128K至256K窗口时, 这个差距进一步扩大到79.3%相较于33.6%。

呈现类似趋势的还有系列测试, 在父节点追踪任务当中, GPT - 5.4所获得的比例为89.8%, mini所获得的比例则是71.5%。

这表明, 在那种存在对于超长度文本, 需开展精准信息查找以及逻辑跟踪的情形之下,mini的能力上限明显要比旗舰版低很多很多呀。

对于那些开发者而言, 他们有着处理大规模文档分析的需求, 还有长对话记忆保持等任务, 在这种情况下, GPT - 5.4依旧是没办法被其他替代的选择。

话又说回来, 这恰恰证实了产品分层逻辑, 不同任务, 使用不同模型。此逻辑为: 不同任务, 对应不同模型。

mini并不需要于每个维度去追平旗舰, 它只需在所主攻的方向表现出色, 这个方向涵盖速度、编码、工具调用以及计算机使用, 达成足够完善的程度即可。

不是结局,是起点

技术在狂奔,但人的情绪要复杂得多。

今早,奥特曼在X上发文:

我对那些逐字逐句写出极其复杂软件的人,充满感激。

现在, 已然很难去想象, 那往昔究竟需要何等大的努力了。多谢你们, 将我们引领至了如今这般境地。

← 返回列表