Geek Savvy

快手与哈工大联手打造开源AI Agents系统、模型、数据全部开源!

大型语言模型(LLM)以其对语言的深入理解和丰富的知识库,展现出了一定的理解和推理能力。尽管如此,即便是目前最先进的GPT-4,当独立运行时,也可能会输出一些看似合理但实际上并不准确的信息,这限制了它与现实世界实时互动的能力。为了克服这一挑战,AI Agents的概念应运而生,它们通过激发大模型的任务规划、自我反思和工具调用等高级功能,使得这些大模型能够利用现实世界的工具来提高内容生成的精确度,并具备解决复杂问题的能力。

最近,快手与哈尔滨工业大学的合作成果「KwaiAgents」,展示了即使是7B和13B规模的“较小”模型,也能够实现超越GPT-3.5的性能。这一突破性的进展不仅令人振奋,而且「KwaiAgents」的系统、模型、数据和评测工具都已经公开,为全球的研究者和开发者提供了一个宝贵的开放资源库。

Image

技术报告:

https://arxiv.org/abs/2312.04889

项目主页:

https://github.com/KwaiKEG/KwaiAgents

在「KwaiAgents」的GitHub页面上,我们可以发现此次开源的内容包括:

系统(KAgentSys-Lite):这是一个精简版的AI Agents系统,它集成了一系列用于事实核查和时效性更新的工具,以确保模型输出的准确性和及时性。

模型(KAgentLMs):经过Meta-Agent Tuning优化的一系列大型模型,它们具备了AI Agents的通用能力。此外,还包括了这些模型的训练数据,为研究者提供了宝贵的资源。

评测(KAgentBench):提供了一套即插即用的Agent能力自动化评测基准(Benchmark),以及人工评测的结果。这为评估和比较不同AI Agents的性能提供了标准化的测试平台。

Image

系统(KAgentSys-Lite)

在「KwaiAgents」项目中,KAgentSys系统是一个以大型语言模型为核心,结合记忆机制和工具库构建的迭代自动化平台。它主要包含以下几个关键组件:

记忆机制:系统整合了知识库、对话历史和任务历史三类记忆,利用混合向量检索和关键词检索技术,确保在规划路径时能够检索到所需的信息。

工具集:系统配备了一系列工具,包括事实增强工具和时效性增强工具。这些工具能够从网页、文本百科、视频百科等多种来源汇集知识,同时提供日历、节日、时间差、天气等实用功能。

自动化循环:在对话过程中,用户提出问题后,系统会更新记忆并检索相关信息,然后调用大模型进行任务规划。如有需要,系统还会调用相应的工具,最后在总结阶段,大模型会综合历史信息给出符合预期的回答。

目前开源的KAgentSys系统将逐步升级和开放更多功能。

模型(KAgentLMs)

在模型方面,为了解决单一模板训练可能导致的过拟合问题,团队采用了Meta-Agent Tuning (MAT)方法。这种方法通过引入多样化的Agent Prompt模板来提升模型的通用性和效果。

Image

MAT分为两个阶段:

模板生成阶段:设计Meta-Agent来生成针对特定问题集合的实例化Agent Prompt模板,并通过打分模型与开源模板的结果进行对比,筛选出高质量的模板库。

指令微调阶段:基于上万个模板,构建了超过20万的Agent调优指令微调数据。团队对Qwen-7B、Baichuan2-13B等热门开源模型进行了调优,并提供了使用和参考的资源。

评测(KAgentBench)

评测方面,KAgentBench提供了一个即插即用的Agent能力自动化评测基准,通过人工精细化标注的上千条数据,使得用户能够轻松评估大模型在不同模板下的表现。

Image

KAgentBench通过构建不同种类能力的输入,每个查询配备多个模板和人工编辑的真实回答,旨在全面评测准确性和泛化性。研究显示,经过MAT调优后,7B-13B模型在各项能力上均有显著提升,甚至超越了GPT-3.5的性能。

此外,KAgentSys系统在处理长尾问题和热门问题时,通过调用百科搜索工具和时间差计算工具,能够提供精确的答案,如回答“安东内拉比梅西大多少天?”这类问题。

Image

团队认为,AI Agents是一条充满潜力的道路,未来将持续投入核心技术的研发,并为社区注入新的活力。同时,团队也将探索Agents技术与快手业务的结合,推动更多有趣且有价值的创新应用的实现。