ChaosstuffAI

AI 开发者周刊#004:Multi-Head RAG、AgentGen、RAG Foundry...

这里分享对开发者有用的人工智能技术和信息,每周五发布。

前沿技术

Multi-Head RAG[1]

Image

Multi-Head RAG(MRAG)是一种针对大型语言模型(LLMs)的新型检索增强生成方法。传统的 RAG 方法通常无法有效处理需要检索多个内容差异显著的文档的查询。MRAG 通过使用 Transformer 模型的多头注意力层的激活作为检索多方面文档的关键点,来克服这一限制。研究团队认为,不同的注意力头可以学习捕捉数据的不同方面,通过对应的激活,可以得到更全面地代表数据项和查询的不同纬度的嵌入,从而提高复杂查询的检索准确性。

Parrot[2]:从端到端提升LLM应用程序的性能

Image

LLM 应用程序通常需要设计复杂的工作流程,以完成单一任务,但由于现有的公共 LLM 服务仅提供过于简化的请求级 API,导致在应用层面的重要信息丢失。这使得公共 LLM 服务不得不针对单个 LLM 请求进行盲目优化,从而导致 LLM 应用程序的端到端性能不佳。

Parrot 系统通过引入语义变量这一概念,使得应用层面的知识能够被公共 LLM 服务所识别。语义变量能够标注请求中的输入 / 输出变量,并在连接多个 LLM 请求时创建数据流水线,为编程 LLM 应用程序提供了一种自然的方式。通过将语义变量暴露给公共 LLM 服务,可以进行传统的数据流分析,揭示多个 LLM 请求之间的相关性,从而为 LLM 应用程序的端到端性能打开了全新的优化空间。

AgentGen[3]:通过LLM生成环境和任务增强Agent的规划能力

Image

论文提出了一个新的Agent训练框架AgentGen,它首先利用 LLM 生成环境,然后基于这些环境生成规划任务。为了提高环境的多样性,研究使用一个灵感库,该库由各种领域特定的文本片段组成,作为合成环境的上下文。为了提高生成规划任务的难度多样性,研究提出了一种双向演化方法 Bi-Evol,它从容易到困难的两个方向演化规划任务,以合成一个更平滑的难度曲线的任务集。结果表明 AgentGen 显著提高了 LLM 的规划能力,例如,AgentGen 指令调优的 Llama-3 8B 在整体性能上超过了 GPT-3.5。

NeedleBench[4]:大模型长文本能力评估基准

Image

NeedleBench 是一个旨在评估大型语言模型(LLMs)在长文本检索和推理方面能力的框架,它包括一系列逐步增加难度的任务。这些任务覆盖了多个文本长度间隔(4k, 8k, 32k, 128k, 200k, 1000k 等)和不同的深度范围。该框架允许在文本的不同深度区域中策略性地插入关键数据点,以严格测试模型在多样化上下文中的检索和推理能力。论文对包括Claude-3-Opus 、GPT4-Turbo、GLM-4在内的36个模型进行了实验,结果显示Claude-3-Opus在评测中表现优异,超过了GPT-4,成为表现最好的模型。

开发利器

GitHub Models[5]

GitHub 发布了 GitHub Models,使开发者能够利用包括 Llama 3.1、GPT-4o、Phi 3 和 Mistral Large 2 等在内的顶尖 AI 模型。这些模型可以在 GitHub 的交互式模型游乐场中免费测试,开发者可以在那里实验、比较、测试和部署 AI 应用程序。GitHub Models 还提供了无缝的过渡,允许开发者在 Codespaces 和 VS Code 中将模型引入到他们的开发环境中。目前需要加入等待列表才能使用。

nano-llama31[6]

该仓库是针对 Llama 3.1 模型的一个简化实现,类似于 nanoGPT 对 GPT-2 的简化处理。该仓库的目标是提供一个轻量级、无依赖的 Llama 3.1 架构实现,使得模型的训练、微调和推理变得更加简单。

RAG Foundry[7]

Image

RAG Foundry 是 Intel 开源的一个仓库,旨在通过在专门创建的 RAG 增强数据集上微调模型来提高 LLM 使用外部信息的能力。该库有助于创建训练数据,提供 RAG 技术,帮助使用参数高效微调 (PEFT) 轻松训练模型,最终可以帮助用户使用各种 RAG 特定指标来衡量改进的性能。该库是模块化的,可使用配置文件自定义工作流程。

Memary[8]

Image

Memary 是一个开源框架,旨在为自主代理(如人工智能助手)提供记忆功能。该项目模仿人类记忆的工作方式,通过记忆流、实体知识库和知识图谱等组件,帮助代理记住信息并在此基础上学习和进步。该项目目前支持 Ollama 中所有的 LLM 和 Vision model。

MindSearch[9]

MindSearch 是 InternLM 开源的 AI 搜索引擎框架,具有与 Perplexity.ai Pro 相同的性能。可以使用闭源 LLM(如 GPT、Claude)或开源 LLM(如 InternLM2.5-7b-chat)进行本地部署。

Image
在深度、广度和生成响应的准确性三个方面,ChatGPT-Web、Perplexity.ai(Pro)和 MindSearch 的比较结果

Wiseflow[10]

Wiseflow 是一个敏捷的信息挖掘工具,可以从网站、微信公众号、社交平台等各种信息源中按设定的关注点提炼讯息,自动做标签归类并上传数据库。支持本地化部署。

文章-观点

a16z:为什么人工智能将改变下一代销售技术[11]

文章讨论了人工智能(AI)如何彻底改变未来的销售技术,强调 AI 将重塑销售流程和工作流程,并可能导致现有的销售软件栈发生根本性变化。

每个初创企业与现有企业之间的竞争,实际上是看谁能在对方创新之前获得分销权。在销售技术领域,人们容易认为像 Salesforce 和 Hubspot 这样的现有企业拥有优势。然而,由于 AI 的到来,这些公司的核心系统记录和销售工作流程可能会被根本性地重塑。AI 不仅能够从文本、图像、语音和视频等多种模式中提取客户洞察,还能够自动化销售流程,如潜在客户的研究和电话准备等。文章进一步探讨了 AI 如何改变销售活动,以及新兴的 AI 本地销售解决方案如何不仅仅是现有类别的 AI 增强版本,而是能够实现新的主动销售动作,并服务于多种用例。

领英 AI 落地复盘[12]

领英 AI 的落地复盘揭示了多 Agent 配合和端到端输出的实践过程。在六个月的开发中,领英团队面临了多方面的挑战,包括构建基于生成式 AI 的应用、设计测评过程、将内部 API 转换为大型语言模型(LLM)友好的 API、以及实现端到端的流式输出。文章详细介绍了 AI 在领英的应用,如用户查询的处理流程、系统如何选择合适的 Agent、信息搜集和生成回复的过程。

AI 产品

Just Mark AI收藏夹[13]

使用Just Mark收藏网页时无需手动进行网页的分类管理,AI会自动进行分类和关键词提取。当想要查询收藏的网页时,无需使用精确的关键词进行查询, 只需要记起的任意相关的词汇都能够找到需要的网页,甚至使用任意语言进行查询都可以。

尖酸刻薄的AI[14]

基于Wordware平台开发的一个推文分析Agent,能够在线查找 Twitter 帐户,使用大型语言模型来分析你的个性,最终创建一个包含分析结果的网站。

Image
对马斯克的分析
参考资料
[1]

Multi-Head RAG: https://arxiv.org/abs/2406.05085

[2]

Parrot: https://github.com/microsoft/ParrotServe

[3]

AgentGen: https://arxiv.org/abs/2408.00764

[4]

NeedleBench: https://arxiv.org/abs/2407.11963

[5]

GitHub Models: https://github.blog/news-insights/product-news/introducing-github-models/

[6]

nano-llama31: https://github.com/karpathy/nano-llama31

[7]

RAG Foundry: https://github.com/IntelLabs/RAGFoundry

[8]

Memary: https://github.com/kingjulio8238/Memary

[9]

MindSearch: https://mindsearch.netlify.app/

[10]

Wiseflow: https://github.com/TeamWiseFlow/wiseflow

[11]

a16z: https://a16z.com/ai-transforms-sales/

[12]

领英 AI 落地复: https://mp.weixin.qq.com/s/0AP0kckR_299QHaYq9zFdw

[13]

Just Mark AI收藏夹: https://justmark.1object.ai/zh

[14]

尖酸刻薄的AI: https://twitter.wordware.ai/