文章目录
- 1. 这俩月开源大模型圈,卷得快出火星子了
- 1.1 俩月前我还以为Fable 5是断档天花板
- 1.2 结果现实打脸来得比翻书还快
- 2. GLM-5.3这波升级,路子有点野
- 2.1 同一个基座,全靠后训练开外挂
- 2.2 跑分涨得最夸张的,是真实操作能力
- 3. 第一波实测:给显卡PCB建1:1 3D模型
- 3.1 二十多万行数据,半分钟就吃透了
- 3.2 建模效果,超出预期
- 3.3 槽点也不是没有
- 4. 第二波实测:从零搓个低配版《无人深空》
- 4.1 游戏开发,难的是无缝体验
- 4.2 整体能跑,但bug修到头疼
- 4.3 纯文本模型的痛点,这一刻凸显了
- 5. 真实场景才是试金石:造火箭、抓漏洞
- 5.1 造火箭大赛,终于飞起来了
- 5.2 抓钓鱼AI,是真的狠
- 5.3 闭卷考安全审计,成绩还不错
- 6. 最后扯两句实在的
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/HHX_01
1. 这俩月开源大模型圈,卷得快出火星子了
1.1 俩月前我还以为Fable 5是断档天花板
当初Claude Fable 5刚放出来的时候,那跑分领先的幅度,我都觉得开源模型至少得追小半年。
毕竟人家闭源堆料,开源怎么看都像是骑着自行车追汽车,差着档次呢。
1.2 结果现实打脸来得比翻书还快
先是GLM-5.2悄咪咪贴脸逼近,眼看着就要追上。
紧接着Kimi K3在前端赛道直接反超,后面Qwen 3.8、DeepSeek V4 Pro挨个登场。
一个比一个能打,说这是开源模型最好的夏天,真不是吹。
简直是神仙打架,咱们普通路人白捡福利。
2. GLM-5.3这波升级,路子有点野
2.1 同一个基座,全靠后训练开外挂
说出来你可能不信,5.3和上一代5.2用的是同一个基座模型。
啥意思呢?就好比俩学生高一高二学的课本一模一样。
其中一个高三闭关刷了俩月真题,模考直接从二本线冲到了省前一百。
基座是打基础,后训练就是冲刺刷题,针对性拉满了,提升自然是质变级的。
2.2 跑分涨得最夸张的,是真实操作能力
就说Terminal Bench这个考验真实操作的测试,直接从4.6干到了28.3,翻了整整6倍。
这哪是小版本更新啊,这是偷偷报了个魔鬼冲刺班,纯纯开挂了。
官方说编程能力体感提升50%,网络安全能力甚至能跟Fable 5掰手腕。
光说不练假把式,咱直接上实测验货。
3. 第一波实测:给显卡PCB建1:1 3D模型
3.1 二十多万行数据,半分钟就吃透了
咱没整那种捏个小玩具的简单活,直接甩了份RTX-3080的PCB点位图过去。
二十多万行数据,焊盘长啥样、信号怎么走线,细节拉满。
换我盯着看半小时,能数明白有多少行就不错了,人家半分钟就全理解透了。
3.2 建模效果,超出预期
没一会儿功夫,3D模型就生成出来了。
几千个电容元器件,几乎每个都能在真实显卡上找到对应位置,结构解析得相当准。
还贴心做了器件分类、模块化视角解析,拿去当科普课件都完全够用。
甚至还顺手掏了个供电拓扑演示,看完你都能明白为啥显卡要插好几个供电口。
3.3 槽点也不是没有
毕竟没有工业级源文件,细节上肯定有出入。
比如金手指、板边的小孔洞,就有点自由发挥的意思,跟原型差得有点多。
还有不少元器件简化成了白模方盒子,主打一个神似,细看就有点糙。
对了,PCB上的铜走线默认是不显示的,说是怕密恐患者不适。
我特意叮嘱之后才放出来,密密麻麻一片,看久了确实头皮发麻。
4. 第二波实测:从零搓个低配版《无人深空》
4.1 游戏开发,难的是无缝体验
建模毕竟是已有数据还原,咱再加点难度,从零做个低配《无人深空》。
这玩意儿难就难在两点:无限空间生成,还有从星球表面到太空的无缝飞行。
说白了就是不能一上天就黑屏转场,得跟坐直梯似的,一路顺到底。
4.2 整体能跑,但bug修到头疼
第一版出来,整体逻辑是通的,能正常运行。
但飞机跟背景快融为一体了,无缝飞行也有点卡壳,属于意料之中。
这么复杂的东西一次就做完美,那才叫见鬼了。
来回拉扯调整了几波,效果就很像样了:能飞、能下船采材料,宇宙跃迁也挺丝滑。
4.3 纯文本模型的痛点,这一刻凸显了
但有个渲染bug,前前后后改了五六次都没整明白。
最后还是我提醒,是不是外面多套了一层东西,它才终于反应过来。
说真的,这时候就特别想念多模态模型,截张图甩过去一秒就懂。
纯文本模型就跟闭着眼摸象似的,全靠嘴描述,急死人。
5. 真实场景才是试金石:造火箭、抓漏洞
5.1 造火箭大赛,终于飞起来了
之前有个AI造火箭大赛,在游戏里搓火箭,要求能起飞、入轨、稳定运行。
上一代5.2就挺可惜,结构、力学设计得头头是道,甚至还琢磨着降落回收。
结果动力不够,飞不起来,典型的学霸偏科,空有一身理论没处使。
这次5.3就争气了,起飞、入轨、绕地飞行,一气呵成,把上一代丢的面子全捡回来了。
5.2 抓钓鱼AI,是真的狠
再说说大家都关心的安全问题。
总有人说强模型就得闭源,怕被坏人拿去当矛使。
智谱这思路就挺有意思:矛你管不住,那大家就一起把盾造结实。
不是空喊口号,人家真干过实事。之前安全团队发现可疑服务器,就是用5.3顺着几千个目录、几万份日志往下挖。
最后揪出来个叫Neo的AI Agent,俩月搞了4台服务器、7个域名、6万个邮箱,发了一万八千多封钓鱼邮件,专盯会计税务机构。
整条攻击链被扒得明明白白,直接给摁死在摇篮里。
5.3 闭卷考安全审计,成绩还不错
我们自己也测了把安全审计,拿了个有历史漏洞的老版本Langflow,15万星的成熟项目。
特意要求全封闭进行,不准联网搜任何东西,纯纯闭卷考试。
人家也不慌,拆成几个Agent分头查不同模块,自己盯关键区域。
两个小弟报了同一个问题,它还亲自下场再验证一遍,谨慎得很。
最后整理出16项安全风险,官方后续修复的5个高危漏洞里,它命中了4个。
虽说不是满分吧,但这套审计流程是真的顺,放到真实开发环境里完全能用。
6. 最后扯两句实在的
之前Hugging Face被闭源模型攻击,还是GLM-5.2站出来救的场。
闭源安不安全不好说,但开源圈要是没几个能打的,那才是真的危险。
就像人家说的,最强的矛要是攥在少数人手里,那最好的盾就得所有人都能用。
反正我是不嫌热闹,后面不管出什么新模型,越多选手进来卷,咱们普通用户才越能用上实惠又靠谱的AI。
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/HHX_01