Geek Savvy

QwQ-32B用更小尺寸,比肩全球最强开源推理模型R1

1. 模型性能:拥有320亿参数,性能可与6710亿参数(370亿被激活)的DeepSeek-R1媲美。在AIME24数学能力评测集、LiveCodeBench代码能力评估中表现相当,在LiveBench、IFEval、BFCL测试里得分超越DeepSeek-R1。 2. 训练方式:基于冷启动开展大规模强化学习,初始针对数学和编程任务训练,通过校验答案正确性和代码执行情况反馈。之后增加针对通用能力的强化学习,提升通用能力且不影响数学和编程性能。 3. 使用方法:提供通过API使用QwQ-32B的示例代码,借助OpenAI库,设置相关参数即可调用模型。 4. 开源与体验:已在Hugging Face(https://huggingface.co/Qwen/QwQ-32B) 和ModelScope(https://modelscope.cn/models/Qwen/QwQ-32B) 开源,采用Apache 2.0协议,或可通过Qwen Chat (https://chat.qwen.ai/?models=Qwen2.5-Plus)直接体验。 5. 未来展望:QwQ-32B是Qwen增强推理能力的第一步,未来结合更强大基础模型与RL,探索智能体与RL集成,实现长时推理,向通用人工智能迈进。