今天,姚顺雨在DeepSeek V4前交卷了
提示词:我要去洗车,洗车的地方离家就100米,我是开车去呢,还是走着去呢?
提示词:父亲和母亲可以结婚吗?
提示词:生成一个Xbox 360控制器的SVG代码。
提示词:用一个HTML代码块编写一个3D精灵球,它应该是可交互的,并且在打开时会有随机的宝可梦从里面出来。
提示词:创建一个骑自行车的鹈鹕的3D像素艺术作品。尽可能将场景刻画得非常细致,注意主体模型上的每一个小细节,同时也要考虑周围环境的细节。在一个HTML代码块中完成制作,将代码写得足够优秀,以展示你的水平超越其他作品。我赋予你完全的创作自由,尽情发挥。
在后端工程任务集Hy-Backend上,Hy3 preview得分达到54.7,超过GLM-5和Kimi-K2.5;在更贴近用户交互的Hy-Vibe评测中,其表现同样领先Kimi-K2.5;在高难度软件工程任务Hy-SWE Max上,Hy3 preview达到30,明显高于Kimi-K2.5、接近GLM-5,但与Claude Opus-4.6仍存在差距。
这类内部评测更强调“真实开发环境中的完成能力”,相比标准化榜单,更能反映模型在复杂工程任务中的实际可用性。
在更细分的Agent专项评测中,Hy3 preview也呈现出类似趋势。在WildClawBench(text-only)中,其得分为45.3,高于Kimi-K2.5、接近GLM-5;在ClawEval评测中达到55.0,超过Kimi-K2.5、接近GLM-5,但与Claude Opus-4.6同样存在差距。
这类评测更关注模型在多步调用、工具协同与任务拆解中的稳定性,直接对应Agent在真实环境中的执行能力。