ChaosstuffAI

AI 开发者周刊#005:长文本 vs RAG、Transformer Explainer、AI 科学家...

这里分享对开发者有用的人工智能技术和信息,每周五发布。

前沿技术

Transformer Explainer[1]

Image

Transformer Explainer 是一个为非专家设计的交互式可视化工具,帮助你通过 GPT-2 模型轻松理解 Transformer 的复杂概念。不需要安装或特殊硬件,只需在浏览器中运行 GPT-2 实例,即可实时观察 Transformer 内部组件和参数如何协同工作,预测下一个词汇。

AI Scientist[2]

Image

Sakana AI 团队推出 The AI Scientist,这是首个能够自动化整个科研流程的 AI 系统。从提出想法、编写代码、进行实验到总结结果,再到撰写论文和同行评审,它都能全程搞定。

系统已成功在机器学习领域产出4篇研究论文,展现了强大实力。并且,项目已开源!

FalconMamba 7B[3]

Image

最新发布的 Falcon Mamba 模型突破了目前 Transformer 架构在处理长序列时的计算和内存限制。基于 Mamba 架构,并加入额外的 RMS 归一化层,Falcon Mamba 能够在不损失性能的情况下处理任意长度的序列,且内存占用不随序列长度增加。无论多长的上下文,生成新 Token 的时间恒定。

使用文档构建高质量指令数据集微调LLM[4]

Image

本研究提出了一种利用 LLMs 和与 Retrieval-Augmented Generation(RAG)相关的框架的流程,通过使用自定义文档集合,构建高质量的指令数据集,用于在特定领域上对 LLMs 进行微调。该流程通过摄取领域特定的文档,生成相关且上下文适当的指令,有效地创建了一个全面的微调数据集。这一方法克服了传统数据集创建方法的局限性,后者通常依赖于手动策划或可能引入噪声和不相关数据的网页抓取技术。尤其是,该流程提供了一个动态解决方案,能够快速适应领域特定文档集合的更新或修改,消除了完全重新训练的需要。此外,它通过使用有限的初始文档集来生成指令数据集,解决了数据稀缺问题,使其适用于那些缺乏全面数据集的不受欢迎或专业化领域。

HybridRAG[5]

HybridRAG 是一种新型的信息提取方法,它通过整合基于知识图谱的检索增强生成技术(GraphRAG)和基于向量数据库的检索增强生成技术(VectorRAG),旨在解决从金融领域的非结构化文本数据中提取复杂信息的挑战。该研究指出,即使是最先进的大型语言模型(LLMs)在面对金融领域特定术语和复杂文档格式时,也存在挑战。HybridRAG 通过同时从向量数据库和知识图谱检索上下文信息,能够生成准确且与上下文相关的问答(Q&A)系统答案。研究团队在一组财务收益电话会议记录上进行了测试。实验结果表明,HybridRAG 在信息检索和答案生成的准确性上,优于单独使用传统的 VectorRAG 或 GraphRAG 技术。

AgentWrite[6]

Image

AgentWrite 是一个基于代理的流程,能够将超长文本生成任务分解为子任务,使得现有的 LLMs 能够生成连贯的超过 20,000 词的输出。利用 AgentWrite,作者构建了 LongWriter-6k 数据集,其中包含了从 2k 到 32k 词长度的 6,000 个 SFT 样本。通过将这个数据集融入模型训练,研究者们成功地扩展了现有模型的输出长度,同时保持了输出质量。

rStar[7]:相互推理使小型法学硕士成为更强大的问题解决者

Image

论文提出了一种名为 rStar 的方法,旨在提升小型语言模型(SLMs)的推理能力。该方法通过将推理过程分解为自我对话的生成 - 鉴别过程,使得 SLMs 能够在不进行微调的情况下提升性能。

具体而言,目标 SLM 首先通过增强的蒙特卡洛树搜索(MCTS)算法,结合一系列人类般的推理行为,构建高质量的推理轨迹。然后,具有与目标 SLM 相似能力的另一 SLM 作为鉴别器,对目标 SLM 生成的每个推理轨迹进行验证。通过双方的共同认可,这些推理轨迹被认为是互相一致的,因此更有可能正确。实验结果表明,rStar 在多种推理问题上都表现出了有效的解决能力,包括 GSM8K、GSM-Hard、MATH、SVAMP 和 StrategyQA。

定义LLM的任务可行性范围[8]

本研究论文探讨了大型语言模型(LLMs)在面对超出其知识和能力范围的查询时,如何识别并拒绝不可行的任务。该研究针对大型语言模型(LLMs)在处理不可行任务时的挑战,提出了对 LLMs 不可行任务的系统概念化,并提供了正式定义和分类,涵盖了与之相关的幻觉谱系。研究者们还构建了一个新的数据集,包含多种不可行和可行任务,用于测试多个 LLMs 对任务可行性的能力。

开发利器

Claude Prompt Caching[9]

Image

Anthropic 推出了 prompt caching 功能,使得开发者能够在使用 Anthropic API 时,缓存常用的上下文信息,从而在后续的请求中减少成本和延迟。这一功能支持 Claude 3.5 Sonnet 和 Claude 3 Haiku,预计将支持 Claude 3 Opus。适用场景包括:会话代理、编码辅助、大型文档处理、详细指令集、智能搜索和工具使用,以及与书籍、论文、文档、播客转录等长篇内容的交互。LangChain也迅速支持了该功能。

GLM-4-Long[10]

Image

智谱 AI 推出了 GLM-4-Long 模型,支持 1M 上下文长度,能够处理长文本任务,如财报分析、论文总结、小说内容理解,具有深入对话理解、复杂文档处理、连贯内容生成和强数据分析能力。同时 GLM-4-Long 的输入输出价格仅为 0.001 元 / 千 tokens。

Swiftide[11]

Image

Swiftide 是一款专为检索增强生成(RAG)量身定制的数据索引、处理和查询库。它在构建大型语言模型(LLM)应用时,为这些模型提供了访问外部资源的能力。数据经过转换、丰富、分割、嵌入和持久化等步骤,以适应模型的需求。借助Swiftide,查询可以通过检索索引数据并生成答案来增强,从而提供更准确和全面的信息。Swiftide 采用 Rust 语言构建,利用并行和异步流技术,确保了其卓越的性能和速度。

LlamaParse CLI[12]

LlamaParse CLI 是一个 PDF 解析工具,可以轻松将复杂 PDF(包括文本、表格和图片)转换为机器和大语言模型可读的 Markdown 格式,只需一个简单的终端命令即可完成。

文章-观点

LLM 的涌现能力仅仅是上下文学习的结果吗?[13]

大型语言模型中的“涌现能力”一直是讨论的热点,但新的研究表明,这些能力并非真正涌现,而是由上下文学习、模型记忆和语言知识共同作用的结果。通过1000多次实验,研究明确指出,语言模型的表现应被谨慎解读,避免高估其能力。

LLM 的长上下文 RAG 性能[14]

Image

本文通过大量实验对 13 种流行的开源和商业 LLMs 进行了性能评估,旨在探究长上下文对 RAG 应用质量的影响。研究发现,虽然检索更多文档可能对提高 LLMs 的准确性有益,但在某些情况下,过长的上下文可能会导致模型性能下降。例如,Llama-3.1-405b 的性能在 32k 令牌之后开始下降,而 GPT-4-0125-preview 在 64k 令牌之后也出现了性能下降。通过对 Llama-3.1-405b、GPT-4、Claude-3-sonnet、DBRX 和 Mixtral 的深入分析,发现了独特的失败模式,如因版权关切而拒绝或总是总结上下文内容。研究还揭示了 “中间丢失” 问题,即模型在处理长文本时难以有效利用中间部分的信息,以及有效上下文长度的概念,即模型性能开始下降的上下文长度可能远低于宣称的最大值。

长文本和 RAG 如何选择?[15]

文章首先对长文本处理和 RAG 进行了对比,指出长文本在准确率上通常优于 RAG,尤其是在处理复杂文本和生成图表等方面。长文本处理的优势在于能够更全面地分析和提取相关信息,但随着文本长度的增加,会遇到性能瓶颈,如并发性能下降和延迟增加等问题。

RAG 方法虽然在处理大规模数据时成本效益较高,但在准确性和延迟方面可能不如长文本处理。文章进一步探讨了长文本和 RAG 在不同场景下的应用,如客服、销售代理、AI 编程和搜索等,分析了各自的优势和适用情况。在客服和销售代理场景中,长文本和 RAG 的选择取决于知识库的复杂度和问题的延迟要求。

在 AI 编程场景中,两种技术都有其适用的细分赛道,且需要根据具体场景进行技术选型和产品设计。在搜索场景中,RAG 由于成本较低,更适合商业服务,而长文本处理则在特定情况下提供更高的准确率。

我们可以依靠 LLM 代理制定长期计划吗?[16]

该研究以实际的旅行规划任务 Travel Planner 为例,研究了基于大型语言模型(LLM)的自主代理在处理复杂规划任务时的表现。研究围绕四个关键问题展开:(1)LLM 代理在面对冗长和嘈杂的上下文时的鲁棒性;(2)少量样本提示对长上下文场景性能的影响;(3)通过细化方法改善规划的可靠性;以及(4)结合正面和负面反馈对 LLM 进行微调是否能带来进一步改进。实验结果表明 LLM 在处理长文本时可能会忽略关键信息,且在分析长期规划和提供准确反馈方面存在困难。为了解决这些问题,研究提出了一种反馈感知微调(FAFT)方法,该方法利用正负面反馈,相较于传统监督微调(SFT)实现了性能提升。

AI 产品

嘴替.app[17]

Image
罗永浩的辟谣号

继上周分享过的尖酸刻薄AI(https://twitter.wordware.ai/),没想到国内开发者那么快就复刻了一个嘴替.app,能够从微博上读取博主的推文然后分析性格进行评价,同样十分毒舌😛。

Me.bot[18]

Image

Me.bot 是一个个性化的生活助手,旨在提供灵感和伴侣般的支持。Me.bot 的工作原理是允许用户记录任何内容,将其组织并保存终身,帮助用户发现生活的可能性,并从记忆输入中产生创意。

商业洞悉

儿童陪伴正成为AI应用的下一个风口[19]

儿童陪伴正成为 AI 应用的新兴市场,吸引了 OpenAI 的投资和大厂高管的加入。

全球玩具市场规模达到 1830 亿美元,且持续增长,儿童因其对新交互方式的接受度和情感陪伴需求,成为 AI 最佳用户群体。OpenAI 投资了儿童游戏生成器公司 Heeyo,而美团副总裁包塔、学而思网校负责人刘庆逊等大厂高管也进入了这一领域。AI 儿童陪伴产品不仅能传授知识,还能提供情感陪伴,成为家长的好帮手。目前,硬件 + 多模态是产品落地的主流路径,多项儿童陪伴项目已经取得了一定的进展。

参考资料
[1]

Transformer Explainer: https://poloclub.github.io/transformer-explainer/

[2]

AI-Scientist: https://github.com/SakanaAI/AI-Scientist

[3]

FalconMamba 7B: https://huggingface.co/blog/falconmamba

[4]

使用文档构建高质量指令数据集微调LLM: https://arxiv.org/abs/2408.05911v1

[5]

HybridRAG: https://arxiv.org/abs/2408.04948

[6]

AgentWrite: https://arxiv.org/abs/2408.07055

[7]

rStar: https://arxiv.org/abs/2408.06195

[8]

定义LLM的任务可行性范围: https://arxiv.org/abs/2408.05873v1

[9]

Claude Prompt Caching: https://www.anthropic.com/news/prompt-caching

[10]

GLM-4-Long: https://mp.weixin.qq.com/s/fOriXFuj9CghfqCx_wsG3A

[11]

Swiftide: https://github.com/bosun-ai/swiftide

[12]

LlamaParse CLI: https://github.com/0xthierry/llama-parse-cli

[13]

LLM 的涌现能力仅仅是上下文学习的结果吗?: https://arxiv.org/abs/2309.01809

[14]

LLM 的长上下文 RAG 性能: https://www.databricks.com/blog/long-context-rag-performance-llms

[15]

长文本和 RAG 如何选择?: https://mp.weixin.qq.com/s/irGk9u2TfLOXW6Pc-J0how

[16]

我们可以依靠 LLM 代理制定长期计划吗?: https://arxiv.org/abs/2408.06318

[17]

嘴替.app: https://zuiti.app/

[18]

Me.bot: https://www.me.bot/

[19]

儿童陪伴正成为AI应用的下一个风口: https://mp.weixin.qq.com/s/tav3smA_tj4cA51_AcBMlw