OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能

客服微996438434个月前财经知识47

OpenAI周二推出旗下迄今能力最强的两款小型模型GPT-5.4 mini与GPT-5.4 nano,以更低延迟和更低成本大幅缩小与旗舰模型的性能差距。

GPT-5.4 mini在编程、推理、多模态理解及工具调用等核心维度全面超越上一代GPT-5 mini,运行速度提升逾2倍,并在SWE-Bench Pro等基准测试中接近体量更大的GPT-5.4。

GPT-5.4 nano则定位成本最低、延迟最短的轻量选项,仅通过API向开发者开放,专为数据分类、提取及简单编程子任务设计。

OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能__OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能

两款模型的推出,意在填补大模型在实时交互场景中因延迟过高而难以落地的空白,直接影响覆盖编程助手、AI代理系统及多模态应用等快速增长的商业市场。

mini面向消费端,nano专属API

GPT-5.4 mini今日起在OpenAI API、Codex平台及ChatGPT三大渠道同步上线。

GPT-5.4 mini的API定价为每百万输入token 0.75美元、每百万输出token 4.50美元,支持文本与图像输入、工具调用、函数调用、网页搜索、文件检索、计算机操控及技能扩展,上下文窗口达40万token。

在Codex平台,GPT-5.4 mini仅消耗GPT-5.4配额的30%,开发者处理简单编程任务的成本约降至旗舰模型的三分之一。Codex还支持将工作量委派给以GPT-5.4 mini运行的子智能体,使推理密度较低的任务自动落入更廉价的模型。

在ChatGPT端,Free与Go用户可通过"+"菜单选择"Thinking"功能使用GPT-5.4 mini;其余付费用户在GPT-5.4 Thinking触达速率上限后,该模型将作为自动降级备选项启用。

GPT-5.4 nano目前仅通过API供开发者调用,定价为每百万输入token 0.20美元、每百万输出token 1.25美元,为两款新模型中定价最低者。OpenAI表示,nano适合由高阶模型统筹调度、负责处理次要支撑任务的子智能体场景。

OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能_OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能_

mini逼近旗舰,nano超越前代

从OpenAI公布的评测数据来看,GPT-5.4 mini在编程及多模态任务上的表现尤为突出。

在编程基准SWE-bench Pro上,mini得分54.4%,与GPT-5.4的57.7%差距收窄至3.3个百分点,远高于GPT-5 mini的45.7%。

OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能_OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能_

在计算机操控基准OSWorld-Verified上,mini以72.1%逼近GPT-5.4的75.0%,并大幅领先GPT-5 mini的42.0%。

OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能_OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能_

工具调用能力方面,GPT-5.4 mini在τ2-bench电信测试中得分93.4%,较GPT-5 mini的74.1%提升显著。在通用智能测试GPQA Diamond中,mini得分88.0%,nano亦达82.8%,均超越GPT-5 mini的81.6%。

_OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能_OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能

值得关注的是,GPT-5.4 nano在部分视觉任务中表现落后于GPT-5 mini,OSWorld-Verified得分39.0%低于后者的42.0%。但在编程及工具调用类任务上,nano仍较前代实现明显提升。

OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能__OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能

OpenAI表示,nano的设计优先级在于低延迟与低成本,而非全面性能,开发者在选型时需结合具体任务权衡取舍。

子智能体架构,多模型协作成产品设计新范式

OpenAI在发布材料中着重强调了两款新模型在多模型分层系统中的位置。

以其自研编程助手Codex为例,GPT-5.4负责规划、协调与最终判断,而GPT-5.4 mini子智能体则并行处理代码库检索、大文件审阅及辅助文档处理等粒度更细的子任务。

OpenAI表示,随着小型模型速度更快、功能更强大,开发者无需使用单一模型处理所有任务,而是可以构建系统,由大型模型负责决策,小型模型则快速大规模地执行任务。OpenAI称:

GPT-5.4 mini 是我们迄今为止针对这种工作流程最强大的小型模型。

这一架构对高并发的工作尤为关键,在编程助手、截图解析及实时图像理解等场景中,响应延迟直接影响产品体感,最优选择往往不是能力最强的模型,而是能够在速度、工具可靠性与任务表现之间取得最佳平衡的模型。

对开发者而言,GPT-5.4 mini与nano的发布意味着在不牺牲系统整体智能水平的前提下,大幅压降推理成本的路径进一步清晰。

相关文章

OpenAI:人类打字速度将成通用人工智能发展瓶颈

OpenAI:人类打字速度将成通用人工智能发展瓶颈

IT之家 12 月 15 日消息,据《商业内幕》今天报道,OpenAI Codex 产品负责人 Alexander Embiricos 昨天出席《Lenny's Podcast》播客,与观众对谈 AI...

推出“ChatGPT健康”,OpenAI被蚂蚁刺激了?

推出“ChatGPT健康”,OpenAI被蚂蚁刺激了?

OpenAI终于忍不住,踏足“AI医疗健康”领域了。 1月8日,OpenAI推出ChatGPT健康功能,可解答健康问题、关联智能设备、规划饮食运动。这种产品,国内的用户已经不陌生,最典型的就是蚂蚁阿...

被OpenAI盯上的中国公司,要去港股上市了

被OpenAI盯上的中国公司,要去港股上市了

“OpenAI一直在领跑,所以最直接的方式是先达到他们的水平。”这是智谱CEO张鹏在一次访谈中对团队目标的概括。 如今,这个愿景在资本市场的推动下又接近了一步。近日,在招股书披露数周后,智谱正式启动...

背靠OpenAI的机器人初创1X亮相CES展示家务机器人,售价2万美元

背靠OpenAI的机器人初创1X亮相CES展示家务机器人,售价2万美元

挪威与美国合资的人工智能(AI)机器人初创公司1X Technologies AS在CES 2026上展示其家务人形机器人NEO,该机器人于去年10月末开放预订,计划今年开始向美国市场交付。这标志着获...

英伟达和谷歌,美国AI棋局的楚河汉界

英伟达和谷歌,美国AI棋局的楚河汉界

最近,OpenAI又传出购买芯片的消息,但采购对象却并非英伟达或谷歌。 据了解,这笔订单落在了晶圆级芯片公司Cerebras身上,协议总金额超过100亿美元、对应最高约750兆瓦算力容量,并将分阶段...

仅用一周时间,谷歌就让OpenAI认清现实

仅用一周时间,谷歌就让OpenAI认清现实

究竟是什么样的更新,才能让谷歌CEO皮查伊称之为“众望所归”(Answering a top request from our users)? 那就是谷歌Gemini最新的Personal Int...

发表评论    

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。
客服微信:BT86616点击复制并跳转微信