GLM-5.2、K3、Qwen3.8-Max-Preview 大比拼,谁能在网站改版测试中笑到最后?

📅 2026/7/23 7:43:31 👁️ 阅读次数 📝 编程学习
GLM-5.2、K3、Qwen3.8-Max-Preview 大比拼,谁能在网站改版测试中笑到最后?

模型竞争态势初现

Anthropic 亮出“最危险”的模型 Mythos 时,其 CEO、坚定的反华头子 Dario Amodei 判断,中国模型追上这类能力还需 6 至 12 个月。但后来,智谱反手推出 GLM-5.2 追赶编程前沿,Kimi 又拿出 2.8 万亿参数的 K3,华尔街一度重演“DeepSeek 时刻”。紧接着,阿里巴巴推出了 2.4 万亿参数的 Qwen3.8-Max-Preview,按官方说法,其综合性能仅次于 Fable 5,在全栈开发、数据分析和 Office 工作流中已能对垒前沿模型。

测试背景与目标

Qwen3.8-Max-Preview 能把中国开源模型叙事讲下去么?决定让近几个月三款旗舰级的中国开源模型 GLM-5.2、K3 和 Qwen3.8-Max-Preview 一起合作,开发正在改版的硅星人/品玩新网站。为弱化 Harness 的影响,工作方式采用了“模型 + opencode”的组合。值得指出的是,正在改版的硅星人网站是个半成品,网站项目已包含 Next.js 前端、Payload CMS、Anime.js 页面动效等,也积累了现成的设计规范、历史代码和工作文档。不过,这个网站问题很大,历史上多次进行前端和后台的开发和维护,屎山代码堆积,结构臃肿,前端交互混乱、虚假的不可用的功能很多,前端和后端 bug 交缠在一起,是糟糕的网站开发范本,必须被改变。对模型来说,空白项目没有历史包袱和屎山代码,往往可以自如发挥;而半路项目通常是模型最严厉的“父亲”,它要求模型看得懂项目在当下状态,还要在不破坏现有功能的情况下,进行精确的修改,属于屎上雕花的高难度操作。

测试项目及结果

项目进展分析

这次网站改版眼下需要解决六个问题,先测试谁看懂了项目当前的进展。结果是 No.1 Qwen 3.8-Max,No.2 Kimi K3,No.3 GLM 5.2。这轮对应网站改版的第一个诉求是分清“现在有什么”和“文档里曾经想做什么”。接手半路项目,最怕模型把旧文档当成当前需求,把已经完成的功能重新做一遍。所以,没立刻让三个模型修改代码,而是先让它们分析项目,看看谁能更快摸清现状。从生成速度来看,Qwen 3.8-Max-Preview 最快,10 秒内解决,其次是 GLM-5.2,最后是 Kimi K3。三个模型像不同风格的开发者,GLM-5.2 像经验丰富的老师傅,准确地找到了 14 个 CMS 集合、Payload 版本锁定和数据库检查机制,对项目底层结构的理解最深,但把四月份的旧方案也当成了当前施工计划,将全文搜索列为待办事项,实际上搜索、筛选和结果高亮早已完成。Qwen 3.8-Max 更像每天待在现场的监工,生成速度最快,也最准确抓住了项目最近在做什么。Kimi K3 则像一个一分钟带你看完房子的中介,用很短的篇幅讲清楚了房间布局,但把 14 个 CMS 集合数成了 15 个,还把隔壁的工作记录文件夹介绍成了“文档仓库”。在搞清现阶段需求上,Qwen 3.8-Max 得分最高,全貌感略欠,但最快也最精准地找到了问题。其次是 Kimi K3,它知道自己要做什么,但速度太慢了,它看得到全局,但太粗心了,经常嘴瓢说错。而 GLM 5.2 把旧文档当成了当前需求,把已经完成的功能重新做了一遍,属于搞不清楚状况。

解决网站报错

这轮对应第二个诉求:模型能不能把诊断变成行动。启动前端页面,却没同时打开 CMS,因此网页出现报错,把报错信息直接交给三个模型处理。三个模型都定位到了问题,但后续动作明显不同。Qwen 3.8-Max 快人一步,直接帮启动了 CMS。Kimi K3 只给出解决方案,并没有实际执行。GLM-5.2 的处理速度较慢,等它准备启动 CMS 时,公共端口已经被 Qwen 3.8-Max 占用,于是它直接复用了 Qwen 3.8-Max 启动的服务。在报错需求解决上,Qwen 3.8-Max 仍然排名第一,它启动了 CMS,而且最快。GLM-5.2 排第二,慢了一步,但它发现端口被占后选择复用已有服务,这是正确且成熟的工程判断。而 Kimi K3,只交方案不动手,只能排第三。

轮播图效果实现

把三个模型切换到独立端口,测试它们精确修改前端的能力。首先是快讯板块,希望它实现自动轮播和无缝循环,但现有动效会让卡片逐张向左平移,播放到最后一张时,再让整个列表向右滑回开头。promtps 要求修改首页“此刻发生”板块,实现无缝无限轮播,所有卡片持续向左移动,第 08 张卡片移出后,第 01 张卡片从右侧自然接上,循环播放,不能在播放到最后一张后,让整个列表向右滑动返回开头,循环衔接时不能出现停顿、跳动或空白,只修改前端轮播效果,不修改数据和后端。结果三个模型最终或多或少都有些问题。Qwen 3.8-Max 自作主张删除了鼠标拖动功能,严重扣分,它用长度伪装成循环,只在表面上实现了循环联播,播放到最后一轮时,卡片仍然会重新跳回开头。Kimi K3 把直线跑道改成了环形,却删掉了自动轮播功能,用户只有拖动鼠标,卡片才会继续前进,而且在动画细节上不够精细,画面会跳帧。GLM-5.2 实现得最完整,既保留了自动轮播,也支持鼠标拖动,还能持续循环,但和 Kimi K3 存在同样的问题,旧卡片消失得太快,循环衔接时仍然会突然跳一下,离真正的无缝循环只差最后一点收尾。GLM 5.2 可以排第一,它是唯一一个功能清单完整的,但需求解决未完整达标。Kimi K3 把最难的部分做对了,但删掉自动播放和衔接跳帧,是个诚实的半成品,可排第二。Qwen 3.8 Max 问题严重,删了鼠标拖动,自作主张改了需求,其方案是伪装出来的,而且架构上是死路,要真正实现无缝循环,就得推倒重来。

修改现有功能

修改了“最新观点”部分的强调色和卡片动效,prompts 要求修改首页“最新观点”板块,将强调色改为科技蓝(#3157FF),应用于栏目标题、序号和悬停状态,卡片增加浅蓝色边框和圆角,鼠标悬停时轻微上浮、边框变蓝,其他布局和内容保持不变,只改前端。这项测试考察的不是模型能不能认对颜色,而是修改范围是否完整、一致。任务实际涉及标题、序号、卡片背景、边框、圆角和鼠标悬停状态等,页面里还有多种变体,任何一处遗漏,都会让新旧两套设计同时出现在用户面前。Qwen 3.8-Max 的修改速度最快,文字颜色、背景颜色、边框和圆角基本都处理正确,但鼠标悬停后的交互色仍然是绿色,没有同步改成蓝色,即没有修改交互层的颜色。Kimi K3 这一轮问题很大,它修改了边框、圆角和其中一处颜色,其他部分几乎没有变化。GLM-5.2 没有直接修改代码,而是先问了两个问题,明确询问过的部分完成得不错,未被方案覆盖的地方却出现了遗漏,最大卡片的鼠标悬停颜色仍然是绿色,只有小卡片变成了蓝色,下方没有图片的卡片,交互颜色也完全没有修改。这一轮,Qwen 3.8-Max 的整体完成度最高,尽管漏掉了悬停色的修改。GLM-5.2 在已经确认的范围内做得更细,事先确认范围的动作很重要,但它的执行背叛了它的流程,问到的地方做得漂亮,没问到的地方彻底放飞了。相比之下,Kimi K3 不得不垫底,它明显没有吃透任务,只动了边框、圆角和一处颜色。

考验模型审美

前两轮考验的是精确执行,这一轮把问题反过来,不给参考答案,让模型自己做审美判断。让三款模型重新设计首页 Hero 区域,promtps 要求体现科技媒体的专业感、前沿感和编辑气质,保留现有标题、文案和按钮,但可以重新设计排版、字体层级、留白、色彩和动效,标题应成为第一视觉焦点,整体要有鲜明风格,但不能做成常见的科技公司官网模板,避免霓虹渐变、玻璃拟态、粒子背景和过多装饰,动效应克制、流畅,并适配桌面端和移动端,只修改 Hero 区域前端,不修改导航栏、其他板块、内容数据和后端。Qwen 3.8-Max 采用了粗体极简风,超大的黑色无衬线标题被分成三行,占据页面左侧的主要空间,背景几乎没有装饰,只用短横线和文字链接建立层级,整体更接近现代媒体首页,视觉重心完全落在标题上。Kimi K3 采用了科技极简风,标题同样使用粗体无衬线字体,但增加了背景层次,左侧承载文案和蓝色按钮,右侧加入网格、细线与柔光组成的背景动效,相比 Qwen 3.8-Max,它使用了更多科技蓝和几何元素。GLM-5.2 采用了杂志编辑风,标题被改成超大衬线斜体,并加入 EDITORIAL、EDITION 2026、01 FEATURE 等期刊元素,页面通过细分隔线、大面积留白和底部滚动提示,形成了类似纸质杂志封面或专题头版的视觉结构。这一轮很难选出唯一赢家,Qwen 3.8-Max 最像现代内容媒体,Kimi K3 的科技感最强,GLM-5.2 则最有杂志封面的编辑气质。它们也暴露了三种不同的理解,Qwen 3.8-Max 认为科技媒体首先是媒体,Kimi K3 认为科技媒体首先要有科技感,GLM-5.2 则把重点放在“编辑”两个字上。而且可以看出,K3 在前端动效上有主动性,而 Qwen 3.8-Max 和 GLM-5.2 就不会主动加动效。如果按对硅星人自身的理解,给 K3 排第一,它的前端审美有口皆碑,且认为“科技感”是第一属性切中要义。第二给到 Qwen 3.8-Max,尽管认为硅星人是媒体,但好歹是个现代内容媒体的风格。只好给 GLM 5.2 排第三。

增加快速审核功能

改完前端,进入 CMS。目前,文章审核只能点进文章逐篇查看,修改的目标是重新组织审核流程,列表要集中展示待审核文章,详情要在当前页面展开,正文要能直接预览,操作完成后还要同步更新文章状态和待审核数量。promtps 要求完善 CMS“审核工作台”,集中显示所有待审核文章,并展示标题、作者、提交时间和当前状态,点击文章后,从右侧展开详情面板,显示文章摘要、正文预览及相关信息,不跳转页面,详情面板提供“审核通过”和“驳回”操作,通过后文章进入待发布状态,操作成功后立即更新列表和待审核数量。出乎意料的是,这一轮最先完成任务的居然是 Kimi K3,一改此前在前端任务中速度最慢的表现。很难据此判断 Kimi K3 是否真的内化了更多前端设计经验,但至少可以确定一件事:模型速度不是固定属性,它会随着任务类型发生变化。从结果来看,Qwen 3.8-Max 的侧边详情最完整,标题、作者、提交时间、状态、分类、摘要和正文预览全部出现,底部也能直接执行“审核通过”或“驳回”,整体最接近 Prompt 要求。Kimi K3 的基本信息和操作功能比较齐全,但正文预览过于简化,用户仍然需要跳转到编辑页才能查看完整内容,没有完全满足“不跳转页面查看内容”的要求。GLM-5.2 提供了摘要和固定操作栏,但正文预览区域主要被一个巨大的图片加载失败占位覆盖,审核人员很难从中获得有效信息,是三个结果中偏离 Prompt 最明显的一个。这轮 Qwen 3.8 - Max 排第一,Kimi K3 排第二,GLM 5.2 完成度比较低,排第三。

模型综合表现总结

几轮测试做完,没有一款模型能够从头赢到尾。不过,Qwen 3.8-Max 至少在这次测试中延续了 Kimi K3 和 GLM-5.2 带来的热度。Qwen 3.8-Max 优势是快,而且对项目当前状态更敏感,它最先完成项目分析,最先启动 CMS,在“最新观点”和“审核工作台”两项任务中也交出了完成度最高的结果,对于希望尽快看到可运行版本的用户来说,这种执行力很有吸引力。但它的缺点同样来自这种快,为了实现轮播,删除了原有的拖动功能,又用复制大量内容的方式伪装无限循环。GLM-5.2 更像一名喜欢先读完资料再动手的工程师,它对代码结构理解最深,轮播功能完成得也最全面,Hero 区域的杂志编辑风格最有辨识度。不过,它速度较慢,也容易被旧文档和自己的分析牵着走。Kimi K3 带来了最多的意外,分析项目时最简洁,数字错误也最多,修改前端时经常漏掉关键要求,却在 CMS 任务中第一个完成,它有时像一个灵感很好的设计师,有时又像一个没有耐心做完检查的实习生。这次测试的结果很难压缩成一个简单排名,如果用最朴素的名次积分(第一名 3 分、第二名 2 分、第三名 1 分)叠加,结果仅供参考,它仅仅是在重构/改造硅星人网站这一个项目上的具体表现,不代表模型的综合和整体性能。