多模态 Agent 到底能干啥?我用 Step 3.7 Flash 跑了一遍
多模态是大模型发展的一个重要方向。最近也能明显看到,DeepSeek 同样在往多模态方向推进,一部分 DeepSeek 用户现在已经可以使用识图模式了。这也说明,主流模型厂商都在持续补齐这部分能力。
阶跃星辰作为主流大模型之一,也同样在往这个方向发展,整体推进速度还是很快的。
新的旗舰模型 step-3.7-flash 是一个多模态模型。多模态能力本身也是生产级 Agent 工作流里的关键一环。开发者不再需要额外去拼接视觉模块,Step 3.7 Flash 可以直接支持截图分析、文档理解、GUI 操作,并且还能和代码生成、搜索、工具调用结合起来,覆盖更完整的生产场景。对于实际落地来说,这一点还是很有价值的。
下面测试一下这个新模型的图片识别能力。 这个原图:
可以看出来,基础的图片识别基本没有什么问题。识别完成之后,还可以顺手利用这个能力去制作一个产品介绍页,整个链路会比较自然,也更符合真实使用场景。
产品页搭建
把参考图给到 Agent,调用阶跃星辰最新的旗舰模型 step-3.7-flash。提示词使用下面这段提示词。
不得不说,阶跃星辰的新旗舰还是一如既往地快,一分钟内就完成了页面的搭建。这个速度在实际体验里还是很明显的。
可以看出,它基本是按照提示词的要求来创建这个产品介绍网站的。网站整体的配色风格也和键盘的主题色比较接近,视觉上会更融洽一些。同时它还加上了一些前端动效,让页面的交互感更强,观感也更完整。
Agent长任务
生产级 Agent 任务,本身就不是一次简单问答能解决的。它往往包含规划、推理、搜索、工具调用、代码生成、多模态理解,以及反复修正等一整条链路。Step 3.7 Flash 更看重的是 Agent loop 每一步的效率,单点能力分数只是其中一部分。下面再测试一下它处理长任务时的表现。
这个是我的任务提示词:
这个任务需要先联网搜索相关数据,下一步再把拿到的数据整理成一份 Word 报告,之后还要把 Word 里的内容继续做成可视化页面。这里用到的技能是 Knowledge Site Creator Skills,它本身是一个偏知识学习方向的技能,所以很适合承接这类内容型任务。
生成的报告:
从报告里可以看出来,Word 内容还是比较全面的,同时也用到了一些数据分析,以及表格、柱状图这类内容展示方式。整体可读性还可以,完成度也不低。
然后再把这个 Word 继续做可视化处理。
从 Agent 反馈出来的网站结构里就可以看出来,这个 skill 其实更适合用来做教育方向的知识网站。当然,拿来做产品介绍也没有什么问题,只是它在知识型内容上的优势会更明显。
使用这个 skill 生成的页面,会天然带有很多学习型元素,比如卡片学习、知识点回顾等等。这些模块放在知识内容里,会显得很顺手,也更容易形成完整的学习体验。
那么它就很适合拿来做教育类的知识网站。
比如,对历史感兴趣的同学,可以做一个历史相关的知识点复习网站;对 AI 感兴趣的同学,也可以做一个 AI 相关知识点的学习网站。这样一来,内容生产和内容展示就能直接衔接起来,效率会高很多。
就比如利用下面这段提示词:
联网搜索,调研Agent调用相关的能力发展和应用,尽量从权威的机构或者信息源进行获取。包括技术博主,行业报告,AI平台资料,官方的技术文档等等。重点梳理Agent从单轮问答到工具的调用,多任务执行,工作流的编排。分析核心能力,应用场景,未来趋势这些。
首先给我一份3000字的word的报告,要求结果清晰,内容完整,语言专业具有易读性。分析上述的这些问题。
然后调用,Knowledge Site Creator Skills,利用这个技能制作一份知识学习网站,网页制作参考技能中的说明,包括首页,Agent调用,发展时间线,核心技术架构等等。
把这段提示词给到 Agent,等待几分钟后就会得到下面这种网页:
一个可视化的知识学习网站也就建好了。这个技能就适合做这种知识类的网页。
新模型在实际编程里的效果又怎么样呢?
编程任务
上次做的 AI 新闻收集网站,其实还只是一个 demo 状态,里面还有很多 BUG,也有不少页面层面的问题。 比如页面配色不统一、布局不协调、导航栏 UI 细节处理不到位等等。然后现在使用新模型对前面的历史遗留问题进行处理。
下面就进行修复。在 Claude Code 里面,只要用自然语言把需求讲清楚就可以了。比如:把运维面板页面的配色和布局优化一下,参考主首页页面的风格。
局部优化就不过多阐述了,加一个新功能,如果收集到的 AI 新闻信息本身是一个视频怎么办?
这时候,多模态模型的优势就体现出来了,因为视频内容它也能处理。这需要对已有的项目添加新功能,下面再介绍一个编程工具 Trae。Trae 写过代码的同学应该都知道,为什么会再次提及呢?因为 Trae 现在支持自定义模型了。之前的 Trae 只能使用固定厂商的模型,这次可选模型的空间就更大了。
现在需要设计一个视频讲解页面,这个页面应该长什么样子,布局,配色,有哪些UI等等,在团队中这些工作是前端,UI和产品的工作,对于个人开发者来说,这些可能了解比较少,这个时候就可以让AI帮我们先设计一份前端UI的界面。这样前面的页面结构和视觉方向会更清楚一些,也方便后面继续落地。这个是GPT帮我生成一张前端UI页面效果。
提示词:
做一个页面做视频讲解的页面,需要有视频的预览窗口,点击视频分析后右边弹出窗口进行视频讲解的输出,根据网页的美观化设计,帮我设计一个这样的页面图再利用这张前端 UI 图片,去生成对应的页面。这次 Step 3.7 Flash 对搜索能力也做了重点升级,能够帮助 Trae 这类 Agent 更高效地获取上下文、理解信息、验证结果,并基于更及时的信息去完成任务。这个提升放在复杂任务里,会更容易感受到差异。
制定任务,对于项目加一个新的功能,需要模型对项目结构的理解,上下文的概况:
新功能的后端接口也在Controller这个文件进行创建,做到了项目文件一致性。
基本上一次性就生成好了,中间也没有出现报错内容。在 Trae 里,任务制定以及每个任务的处理速度,体感上确实比 GPT4.5 快了不少。之前在使用 GPT 模型的时候,模型前置思考往往就要花掉很多时间,这一点在长任务里尤其明显。
虽然它和参考图相比,在风格取向上有所差异,但基本功能已经完成得差不多了,后面剩下的更多就是细节优化和页面打磨。能在这么短时间里先把核心内容搭起来,已经很适合拿来做快速验证了。
结尾
总的来看,Step 3.7 Flash 并非单纯补全多模态能力,而是在识别、编程、长任务执行等多个维度同步推进。从基础的图片识别到产品页快速搭建,再到知识网站自动生成和编程场景的功能扩展,它都展现出了不错的效率与完成度。
更重要的是,它能与搜索、工具调用、代码生成等能力自然衔接,形成完整可落地的生产链路。对开发者而言,这意味着更低的集成成本;对普通用户,则意味着更流畅的交互体验。
多模态只是起点,真正的价值在于它能否成为Agent工作流中可靠高效的一环。从目前表现来看,Step 3.7 Flash 已经迈出了扎实的一步。