Step 3.7 Flash Agent 效率才是真功夫!
阶跃星辰刚发布的 Step 3.7 Flash,官方给出了一个非常直接的产品定位——面向生产级 Agent 的高效率 Flash 模型,为 Agent、Coding、Search 与多模态工作流而生,并且开源、可部署。
1.产品定位
Step 3.7 Flash 是一款专为生产级 Agent 打造的高效率 Flash 模型,核心能力紧扣 Agent、Coding、Search 与多模态工作流,并且开源、可本地部署。它不追求跑分,只死磕“干活”效率,通过Step Plan包月,高频场景实际成本更低。
开源特性让企业能在自有硬件上私有化部署,数据不出域,高频调用成本趋近于零,彻底打破闭源模型的高并发瓶颈。Step 3.7 Flash 把模型竞争从“会答多少题”拉到了“能把活干得多快、多稳、多省”的工程化效率赛道,是面向 Agent 规模化落地的效率利器。
和DeepSeek V4 Flash对比(基于2026年6月22日官方文档数据,1M Tokens计算):
按API单价StepFun略高于DeepSeek,但通过Step Plan包月(按次数而非token计费)实际成本更低。
2.实战一:性价比PK
大模型的能力榜单我们看腻了。真正让技术人挠头的问题永远是:同一个真实 Agent 任务,谁能更快、更稳、更省地跑完?
接下来我们就对比Step 3.7 Flash和DeepSeek V4 Flash模型的对比
这里用脚本驱动模型对比完成同一任务、自动采集指标。
设计一个标准 Agent 任务 任务:自动获取当前 GitHub Trending Python 项目前 5 名,分析每个项目的核心用途,生成一份中文简报,并保存为 Markdown 文件。
这个任务涉及:
1.网页抓取(GitHub Trending 页面)
2.内容解析
3.自然语言总结
4.文件写入
它可以很好地考验模型的多工具串联规划和执行效率。
Step 3.7 Flash模型结果
DeepSeek V4 Flash模型结果
很明显消费金额要远高于Step 3.7 Flash模型
本实战Step 3.7 Flash模型 VS DeepSeek V4 Flash模型对比结果如下:
3.实战二:代码执行PK
用完全相同的任务和工具集去驱动两个模型,你得到的不是排行榜上的几个数字,而是 真实生产环境中能落地的效率账本。这次实测再次印证:当模型从“答题”转向“干活”时,紧凑的工具调用、极低的 token 冗余和稳定的多步执行,才是衡量 Agent 模型的关键标尺。Step 3.7 Flash 正是为这个刻度而生。
任务:查询今天北京和上海的气温,计算温差,并整理成一句简洁的中文天气提醒,写入本地 weather.txt 文件。工具集:
get_weather(city)
calculate_diff(a,b)
write_file(path, content)。
Step 3.7 Flash模型
本实战Step 3.7 Flash模型 VS DeepSeek V4 Flash模型对比结果如下:
4.实战三:Agent效率PK
这次横评的结论朴素而清晰:当模型开始真刀真枪干活时,“会多少题”不再是核心壁垒,“能不能把活又快又稳又省地干完”才是。
Step 3.7 Flash 展现出的特性,不是单纯的推理快,而是一种面向生产级 Agent 的工程化效率——更少的自我对话、更高的工具调用精准度、更极致的 token 经济性,并且通过开源和可部署把控制权完全交给开发者。这种效率在单次交互里也许只是几秒和几分钱的差距,但放大到企业级 Agent 流水线、高频自动化任务中,就是产能和成本的降维打击。
Step 3.7 Flash模型
本实战Step 3.7 Flash模型 VS DeepSeek V4 Flash模型对比结果如下:
5.总结
可以预见,Agent 效率,正在成为下一阶段模型竞争的关键。而至少在这轮实测里,Step 3.7 Flash 已经用“干活”的方式,先赢了一局。
更多介绍可以查看
https://static.stepfun.com/blog/step-3.7-flash/