Claude Opus 5深度实测:编程能力超越Fable 5,价格与Opus 4.8持平

📅 2026/7/27 21:04:23 👁️ 阅读次数 📝 编程学习
Claude Opus 5深度实测:编程能力超越Fable 5,价格与Opus 4.8持平

摘要:Anthropic于2026年7月24日正式发布Claude Opus 5,定价与Opus 4.8完全持平——输入每百万Token 5美元、输出25美元。本文基于深度实测,从多模态理解、3D建模、游戏开发、Android原生应用等多个维度评估Opus 5的实际能力。测试涵盖平面图转3D可探索房屋、科幻飞船还原、复杂AIGC动画、Godot沙盒游戏、原生Android背单词应用等项目。本文基于B站UP主@AI超元域的相关视频内容整理,通过Ai好记完成视频转录和要点提炼,结合Anthropic官方公告与第三方基准测试数据撰写。

目录

  • 1 模型概述与定价信息
  • 2 平面图转3D可探索房屋:多模态理解与空间推理
  • 3 科幻场景生成:从文字与图像到3D世界
  • 4 复杂AIGC与前端能力测试
  • 5 Godot沙盒游戏开发:一小时造出无限探索世界
  • 6 原生Android应用开发:26分钟全自动完成
  • 7 总结与选型建议

1 模型概述与定价信息

Claude Opus 5于2026年7月24日正式发布,Anthropic官方将其定位为“深思熟虑且积极主动”(thoughtful and proactive)的模型,性能接近Claude Fable 5的前沿能力,但价格仅为后者的一半。

核心参数

参数项规格
上下文窗口100万token
知识截止日期2026年5月
输入定价$5/百万token
输出定价$25/百万token
快速模式2倍价格换2.5倍速度
思考档位5档可调(low/medium/high/xhigh/max)

定价与前代Opus 4.8完全一致,但与Fable 5相比直接减半。在CursorBench 3.2基准测试中,最高思考档位下Opus 5与Fable 5的峰值成绩相差不到0.5%,但单任务成本仅为后者的一半。在GDPval-AA知识工作评测中,Opus 5以1861分超越Fable 5的1747分和GPT-5.6 Sol的1736分。在ARC-AGI 3测试中,Opus 5得分30.2%,是第二名GPT-5.6 Sol(7.8%)的近四倍。

知识截止日期为2026年5月,是目前知识截止日期最新的模型之一。

2 平面图转3D可探索房屋:多模态理解与空间推理

第一个测试是让Opus 5根据一张房屋平面图生成3D可探索的交互式项目,使用Godot引擎,支持第一人称视角和自上而下俯视视角。这个测试同时考验模型的视觉理解能力(解析平面图)、空间推理能力(构建3D结构)和代码生成能力(实现交互逻辑)。

运行效果

Opus 5生成了一栋完整的二层房屋3D模型。第一人称视角下,用户可以360度旋转视角,双击任意房间即可进入。房屋结构完整包含客厅(沙发、电视、茶几)、餐厅(餐桌)、厨房(灶台、抽油烟机、冰箱)、洗手间、储物间、书房、两间卧室、阳台等空间,地板纹理和光影效果都做了细致处理。从一层通过楼梯可以上到二层,体验类似在《我的世界》中探索建筑。

个人评价:这个测试结果确实超出了预期。一张2D平面图,模型不仅理解了空间布局,还还原了材质、光影和房间间的连通关系。它不只是“画”了一个3D模型,而是构建了一个完整的、可交互的3D场景。对于需要快速将建筑图纸或室内设计方案可视化的场景,这种能力有实际的应用价值。

3 科幻场景生成:从文字与图像到3D世界

3.1 模拟黑洞生成

使用复杂提示词让Opus 5生成模拟黑洞。运行效果展示了一个具有科幻感的动态黑洞模型,其视觉效果与电影《星际穿越》中的黑洞高度相似——包含吸积盘、光线弯曲等特征。右侧面板支持各项参数调节,用户可以通过调整参数实时观察黑洞的变化。此前测试其他模型时生成的黑洞效果都较为简陋,Opus 5实现了质的飞跃。

3.2 科幻小说飞船还原

输入一段长提示词,要求Opus 5根据科幻小说《极光》还原人类乘坐的“极光号”宇宙飞船。Opus 5还原的飞船包含双轮交替转动的巨大舱室结构、火焰喷嘴、燃料罐体、飞船头部的磁场产生设备(用于清理前方宇宙尘埃)等细节。用户可以进入飞船舱室内部探索,舱室内部还原了地球环境(树木、草地、穹顶天空),不同舱室之间可以通过鼠标切换,控制中心包含座位和屏幕阵列。飞船整体处于前进状态,背景星空持续向后移动。

3.3 根据图像生成重力飞船

将一张AI生成的“能够自动产生重力的宇宙飞船”图像发送给Opus 5,要求其根据图像还原飞船。Opus 5还原的飞船与参考图像高度相似,支持旋转查看,尾部喷射火焰,用户可进入舱室内部透过舷窗观察外部星空。舱室内部屏幕显示实时数据,舱门可自动开关,底部可透过玻璃观察飞船外部效果。

个人评价:从文字描述到3D飞船,从一张参考图到完整的可交互模型,Opus 5在这两个任务中展现的不仅是代码生成能力,更是对复杂空间结构和物理逻辑的深层理解。它能根据小说文本还原出符合原著描述的飞船细节(磁场设备、舱室环境),说明模型在阅读和理解长文本、提取关键空间信息方面有扎实的能力。

4 复杂AIGC与前端能力测试

Opus 5还通过了一系列用于测试模型前端和AIGC能力的经典测试题:

铅笔绘制灯泡动画:生成用铅笔画出一个灯泡的动画,效果接近真实手绘,灯泡边缘的不完美处理反而增加了真实感,手写字母的效果也非常自然。相比此前测试的Kimi K3,Opus 5的效果明显更好。

土星轨道自行车比赛:三只鸟骑着自行车在土星轨道上比赛,三只鸟的编号以特写方式展示,骑行动作流畅自然。

复合弓射箭动画:生成复合弓拉弓射箭的瞬间动画,放箭瞬间箭出现变形效果,拉弓时复合弓的滑轮转动符合真实物理。整体动画近乎完美。

农夫过河推理动画:结合推理与AIGC生成的经典测试题。此前测试过Kimi K3和GPT-5.6,Opus 5生成的效果优于两者,动画步骤完整。

风洞模拟:生成F35战斗机在风洞中的模拟效果,左侧支持各项参数调节。

5 Godot沙盒游戏开发:一小时造出无限探索世界

在Claude Code中将模型设置为Opus 5,使用Godot游戏引擎开发一款模仿Minecraft的第一人称沙盒游戏,背景设定在侏罗纪世界。提示词要求包含恐龙、飞行的翼龙、玩家手持加特林用于狩猎和防御、可投掷手雷等元素。提示词较长,翻译成英文后完整发送给Claude Code。

开发过程与结果

Claude Code全自动开发,耗时约一小时完成。生成的游戏效果超出预期:

  • 武器系统:玩家手中的加特林模型接近《我的世界》风格,射击效果流畅,可射击空中翼龙
  • 手雷系统:投掷后爆炸效果完整
  • 水下战斗:进入水中后可以探索,包含鲨鱼和小鱼等生物,可攻击并击杀
  • 地图生成:持续飞行时地图会持续加载新元素,实现无限探索(此前的测试中地图存在边界限制)
  • 天气系统:包含昼夜变化(月亮、太阳)和雨雪天气
  • 地形多样性:包含荒原、冰原等多种地形,冰原上可以看到雪花效果和恐龙

游戏体验几乎没有边界限制,持续飞行时不断生成新的地形和元素。

个人评价:一小时全自动开发出一款可无限探索的3D沙盒游戏,包含武器系统、天气系统、多种生物和地形生成——这个结果让人有点意外。它不是生成一个demo或概念验证,而是一个真正可以玩的产品。对于独立游戏开发者来说,这意味着从创意到可玩原型的时间被大幅压缩。

6 原生Android应用开发:26分钟全自动完成

在此前测试中,使用相同的提示词让Opus 5开发iOS应用效果完美。本次改用Android原生技术栈,开发一款背单词应用。提示词翻译成英文后完整发送给Claude Code。

开发过程

Claude Code全自动开发,自动打开Android模拟器、自动测试应用功能、自动滑动单词卡片、点击卡片翻转、测试发音功能。整个开发加测试过程耗时约26分钟10秒,全程无需人工干预。

应用功能

在Android Studio中打开项目后,应用包含以下功能:

  • 亮色/暗色主题切换
  • 单词学习:卡片翻转、发音功能(音量较小)
  • 练习测试:选择正确答案后实时反馈
  • 进度与成就系统

由于提示词为英文,UI界面默认显示英文,后续可要求改为中文。

个人评价:从开发到测试全自动完成,26分钟交付一个功能完整的原生Android应用——这在没有AI辅助的时代几乎不可想象。更重要的是,它在开发过程中自己打开模拟器、自己测试功能、自己验证结果,说明Opus 5具备了“边写边验”的工程能力,而不仅仅是“写完再说”。

7 总结与选型建议

7.1 综合评估

Claude Opus 5在本次测试中展现了全面的能力:

  • 多模态理解:能从平面图还原3D建筑结构,能从文字描述和单张图像生成复杂的3D飞船
  • 3D建模与空间推理:房屋、飞船、游戏场景的构建都达到了可用级别
  • 游戏开发:一小时全自动完成Godot沙盒游戏,包含无限地图、天气系统、战斗机制
  • 原生应用开发:26分钟全自动完成Android应用开发与测试
  • 前端与动画:多项AIGC测试题表现优于竞品

在基准测试层面,Opus 5在GDPval-AA知识工作评测中超越Fable 5和GPT-5.6 Sol,在ARC-AGI 3中得分是GPT-5.6 Sol的近四倍。在Frontier-Bench v0.1中,Opus 5性能是Opus 4.8的两倍以上。在AA Intelligence Index上,Opus 5得61分,与Fable 5(60分)基本持平,领先GPT-5.6 Sol(59分)。

7.2 选型建议

需求类型推荐理由
追求极致性能、不介意成本Fable 5纯模型能力略强
追求性能与成本的平衡Opus 5性能接近Fable 5,价格一半
日常开发、快速原型Opus 5价格亲民,编程能力足够
游戏开发(Godot/Unity)Opus 5一小时交付可玩游戏
移动应用开发(Android/iOS)Opus 526分钟全自动开发测试

结论:Claude Opus 5以Opus 4.8的价格提供了接近Fable 5的性能,在编程、知识工作和多模态理解方面表现出色。对于大多数开发者而言,Opus 5是比Fable 5更务实的选择——性能差距在个位数百分比,价格差距却是50%。它专为日常高频使用设计,已成为Claude Max的默认模型。如果你正在寻找一个兼顾性能与成本的编程AI助手,Opus 5值得认真考虑。

参考资料

  • 本文基于B站@AI超元域《🚀Claude Opus 5深度实测!编程能力超越Fable 5!Token价格与4.8完全持平!从一张平面图生成可探索3D住宅,到游戏开发和APP开发》核心测评,使用音视频转笔记工具Ai好记进行精华要点提取、思维导图梳理,视频转文字后,能大幅提高学习效率。如果你也经常通过长视频、音频学习知识,可以先用这个工具进行思路整理与要点分析,亲测好用~