出于数据安全与信息安全的考虑,我们的选型范围局限于京东自有大模型言犀模型,与京东本地化部署的DeepSeek V3/R1模型之间。最初,我们把一个复杂的任务交给具有推理能力的R1,发现虽然偶有惊艳表现,但是极其不稳定,且通过研究其思维链思考输出发现,面对复杂任务,其在推理过程中,会逐步放大误差,导致分析结论幻觉严重,结论完全不可看。因此我们最终确认了R1和V3结合多模型方案,根据任务定位合理配置模型。不同模型幻觉率对比[引用1]目前,Gemini 2.5 Pro 被公认为是推理模型领域中综合能力最强、幻觉控制最为出色的模型之一(在几个月前撰写文章的时候,不代表现在的排名)。然而,由于安全方面的考量限制了其直接应用,计划探索基于开源模型并结合模型蒸馏技术,来自主训练和优化我们自己的推理模型。