从能写代码到能交付:Step 5 Preview 实测体验

摘要

最近,国产模型又迎来一轮更新,多家厂商相继推出旗舰模型。从跑分和实际体验来看,这一轮模型的进步都很明显。

最近,国产模型又迎来一轮更新,多家厂商相继推出旗舰模型。从跑分和实际体验来看,这一轮模型的进步都很明显。

9 月 20 日,阶跃星辰发布了新模型 Step 5 Preview。距离上一次发布 Step 3.7 Flash 还不到四个月,版本号就从 3.7 直接跳到了 5。这个跨度不小,至少从命名来看,阶跃星辰对这次升级很有信心,也把大家的期待值拉高了。

Step 5 Preview 主要面向 AI 编程、软件工程和专业知识工作,重点处理更接近真实工作的长任务,包括读懂复杂需求、消化大量上下文、调用工具、排查问题,最后交出可以运行和检查的成果。除了代码任务,它在金融等专业知识场景也有重点投入。

模型采用稀疏 MoE 架构,总参数量为 600B,每个 Token 激活 27B 参数。简单理解,它具备 600B 参数的容量,但在处理每个 Token 时只调用其中一部分,以此兼顾模型能力运行效率。官方把这个方向称为新一代智能效率的「帕累托前沿

在 Artificial Analysis Intelligence Index v4.3 中,Step 5 Preview 得分 44,已经进入前沿模型梯队。

该模型单任务成本仅为同等智能水平模型 GLM-5.3 和 Kimi K3 的 35%,Claude Opus 5  12.5%.

Step 5 Preview 还支持 1M Token 上下文和视觉输入。1M 上下文让它可以一次读进很长的需求、代码和资料,视觉输入则让它能理解截图、设计稿和图表。放到开发场景里,这两项能力指向同一个目标:减少人在任务中途反复补充背景和拆解步骤的次数。

上面这些指标是不是一个好看的数字,今天就让我们来实际测试一下这个模型的表现。

怎么测试

我们的测试都在 workbuddy 里面测试,在实际执行任务的时候选择不同的模型。

这里有一个例外就是 测试 gpt5.6 sol 这个模型的时候,选择在 Codex 中来执行

每个模型使用独立会话和独立目录。测试前统一工具、Skills、依赖安装权限与运行上限,无法完全一致的配置,会在结果中单独说明。

单缸四冲程汽油发动机的剖面动画

第一个测试项目是单缸四冲程汽油发动机的剖面动画。这类动画主要考验机械联动。活塞、连杆和曲轴要按照同一个曲轴角度运动,连杆长度始终不变;气门开合、火花塞点火和缸内颜色变化,也要与当前冲程一致。

这里使用简化后的教学模型。发动机依次经历进气、压缩、做功和排气,一个完整循环中曲轴旋转两周。真实发动机中的提前点火和气门重叠不在测试范围内,这里只检查四个冲程的基本联动。

我给模型提示词如下。

用 HTML、CSS、JavaScript 和 SVG 制作四冲程发动机交互动画。活塞、连杆和曲轴连续联动,气门、点火和文字说明同步。支持暂停、调速、拖动角度、切换冲程和重置,交付可直接打开的网页及操作说明。

最后网页检查的时候,我不仅需要看动画能不能播放,还可以暂停,检查连杆接头有没有脱开、做功时气门是否关闭,

还可以把角度拖到 90°、270°、450°和 630°。检查这四个位置都在行程中段,气门和活塞的状态是否对不对。

Step 5 Preview

GLM-5.3

DeepSeek-V4.1-Flash

结果如下。

这个测试题三款是一次性完成,中间即便有错误都是自己测试并修复,但成品的差距还是比较很明显。GLM-5.3 把机械结构画得最细,曲轴、连杆、气门和火花塞的位置一眼能看懂。DeepSeek-V4.1-Flash 的面板最紧凑,曲轴角、凸轮轴角、缸内容积都收在右侧。

Step 5 Preview 更像一份已经排好版的教学课件。我把它停在 665°,画面显示排气门开启、进气门关闭、活塞上行,右侧还列出了气门升程和本行程角度。还有就是 这个底部还有一点 没有显示出来,虽然不影响理解,看起来不太完整,另外还有一个就是 我的提示词 明确要求需要交付操作说明,只有 Step 5 Preview 把这个显示到了当前页面

Step 5 Preview 用时 10 分 39 秒,只比这题最快的 DeepSeek-V4.1-Flash 多 4 秒。

三维抓娃娃机

第二测试是三维抓娃娃机。我们不提供任何素材,抓娃娃的机器、玻璃、灯带、爪子和玩偶全靠模型自己用代码搭,没有使用外部模型素材。

这题看着像在比画面,实际更容易翻车的是玩法。爪子要能移动、下落、合拢、抬升、运到取奖口再松开。中间只要一个状态没接好,就会出现抓空也加分、连续点击重复扣币,或者玩偶还在半路分数先涨了。

我给三款模型的提示词如下,提示词还是写的很简单,这个就更加考验模型的细节把握。

制作可操作的三维抓娃娃机。初始 3 枚代币,支持键盘和触屏控制。抓取根据爪子与玩偶的实际位置判断,展示完整抓取过程,抓空不能计分,抓取中不能重复扣币。提供固定测试布局、重新开始和旋转视角功能。

DeepSeek-V4.1-Flash

GPT-5.6 Sol

Step 5 Preview

DeepSeek-V4.1-Flash 用了浅蓝玻璃柜体和高位斜视角,空间关系很清楚,整体偏干净的几何风。GPT-5.6 Sol 走霓虹街机路线,第一眼最抓人,玩偶则更接近图标化的小球造型。Step 5 Preview 做成了粉色实体机台,顶棚、玻璃柜体和取奖口都在。

GPT-5.6 Sol 的配色,确实亮眼。Step 5 Preview 胜在完整,画面里能同时看到操作说明、代币、得分、当前状态和抓取日志。

GPT-5.6 Sol 最快,用了 16 分 38 秒。Step 5 Preview 用了 39 分 19 秒,速度排在中间。

三款抓娃娃机都都通过了我们的测试,功能都比较完成,在抓取过程中有一个不同的点,就是 DeepSeek-V4.1-Flash 和 GPT-5.6 Sol 在移动抓取的时候,底部会显示圆圈,可以很清楚的看到是否能抓取到娃娃,Step 5 Preview 只有在按下空格,机器开始抓娃娃的时候,才能底部看到一个圆圈,增加了抓取难度。

Step 5 Preview 这套最方便复核。抓中以后,分数会增加,我把爪子移到空白处再抓,右侧日志依次出现「投币成功」「到达底部,开始收爪」「判定结果,抓空,不计分」「空抓结束,爪子归位」。

写在最后

这两个测试里,所有参测模型都在首轮通过了验收。单看任务能不能完成,几款模型没有拉开明显差距,区别更多体现在最后交出来的成品上。

做发动机动画时,Step 5 Preview 把运动、状态和讲解放在了同一个页面;做抓娃娃机时,它又把操作说明、代币、得分、运行状态和抓取日志都补齐了。这些内容不影响程序能不能运行,却会影响拿到成品以后,是否容易理解、演示和检查。

Step 5 Preview 的速度不是最快的,视觉效果也没有全面领先。它给我留下印象最深的,是两次交付都比较完整,提示词里提到的要求基本能在成品中找到,不需要我再追着补充。它没有靠某个特别突出的单项赢下测试,但交到我手里的时候,已经比较像一个做完的产品了。

整个体验下来,我觉得 Step 5 Preview 完全配得上它在 AA 上的得分。国产第二、全球开源前三,与 GLM-5.3、K3 跻身新一线模型。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。