ChaosstuffAI

AI 开发者周刊#006:“ 我没有大模型经验,可以给个机会吗?”

这里分享对开发者有用的人工智能技术和信息,每周五发布。

前沿技术

KVQuant[1]

Image

LLMs在文档分析和总结等应用中需要处理大量上下文信息时,KV缓存激活成为推理过程中内存消耗的主要因素。为了压缩KV缓存激活,量化是一种有效的方法,但现有的解决方案在极低精度(如低于 4 位)下无法准确表示激活。KVQuant方法通过引入以下几种新颖的量化技术来解决这一问题:

  • Per-Channel Key Quantization:通过调整沿着哪个维度对 Key 激活进行量化,以更好地匹配分布。
  • Pre-RoPE Key Quantization:在应用旋转位置嵌入(RoPE)之前对 Key 激活进行量化,以减轻量化过程中的影响。
  • Non-Uniform KV Cache Quantization:为每一层衍生出基于敏感性的非均匀数据类型,以更好地表示分布。
  • Per-Vector Dense-and-Sparse Quantization:对每个向量的异常值进行分离处理,以最小化量化范围的偏差。

KVQuant 在 Wikitext-2 和 C4 数据集上实现了使用 3 位量化的少于 0.1 的困惑度退化,超越了现有的方法。该方法在单块A100-80GB GPU上实现了LLaMA-7B模型的100万上下文长度推理,而在8-GPU系统上实现了1000万上下文长度。

xRAG[2]:用于检索增强生成的极端上下文压缩

Image

xRAG 通过将密集检索中的文档嵌入重新解释为检索模态的特征,并通过模态融合技术将这些嵌入无缝地整合到语言模型的表示空间中。这种方法消除了对文本形式的需求,实现了极端的上下文压缩。在 xRAG 中,唯一可训练的组件是模态桥接,而检索器和语言模型保持冻结状态,这允许重用离线构建的文档嵌入,并保持了检索增强的便插式应用特性。实验结果显示,xRAG 在六个知识密集型任务上平均提高了超过 10% 的性能,并且能够适应不同大小的语言模型后端。

Multi-Meta-RAG[3]

Image

Multi-Meta-RAG 通过使用大型语言模型(LLMs)提取的元数据进行数据库过滤,提高了多跳查询的信息检索增强生成(RAG)性能。

多跳查询是指需要从多个数据源中检索信息并进行推理才能回答的查询。与单跳查询不同,多跳查询通常需要跨越多个文档或数据点,才能找到正确的答案。传统的 RAG 技术在处理需要从多个支持证据元素中检索和推理的多跳问题时表现不佳。

为了解决这一问题,Multi-Meta-RAG 方法利用大型语言模型(LLMs)提取的元数据进行数据库过滤,从而提高了对相关文档的选择准确度。研究发现,虽然数据库过滤针对特定领域和格式的问题集,但 Multi-Meta-RAG 在 MultiHop-RAG 基准测试中显著改善了结果。

Meta Agent Search[4]

Image
https://github.com/ShengranHu/ADAS

Meta Agent Search 是一种通过积累先前发现的成果,迭代编程和测试新代理的元代理。该方法通过定义搜索空间、探索搜索算法和评估函数,能够学习包括提示词、工具使用、控制流等在内的任何代理系统。研究显示,这些由 Meta Agent Search 发明的代理在跨域和跨模型应用中依然表现出色。

SysBench[5]:用于系统消息遵循的benchmark

Image
https://github.com/PKU-Baichuan-MLSystemLab/SysBench

SysBench 是一个全新的基准测试工具,用于系统分析 LLMs 在跟随系统消息指令方面的表现。它从约束复杂性、指令不对齐和多轮对话稳定性三个关键维度评估不同模型的能力。SysBench 的数据集涵盖了来自各领域的 500 条系统消息,每条消息都配有人工精心设计的 5 轮用户对话。

视觉驱动文档检索[6]

Image
https://arxiv.org/pdf/2408.10943

ColPali 是一种新型文档检索模型架构,它利用最新的视觉语言模型来生成高质量的上下文化嵌入,通过直接从文档页面图像生成语境化嵌入,不仅能“读取”文本,还能“理解”文档中的图像、表格等视觉信息,大幅提升了检索精度。这种方法消除了对文本提取、光学字符识别 (OCR) 和布局分析的需求,大大简化了文档检索流程。ColPali 采用后期交互相似性机制,允许在查询时比较查询和文档嵌入,以获得更准确、更相关的检索结果。

mPLUG-Owl3[7]

阿里发布的全新通用多模态大模型 mPLUG-Owl3,实现了4秒内观看2小时电影的惊人性能,并且在多图、多视频理解的 Benchmark 上取得了 SOTA 表现。通过 Hyper Attention 模块,显著提升了推理效率,同时保持高准确性。

DeepSeek-Prover-V1.5[8]

Image
https://github.com/deepseek-ai/DeepSeek-Prover-V1.5

DeepSeek-Prover-V1.5 是一个开源的基于 Lean 4 的数学定理证明语言模型,通过优化训练和推理过程,以及引入强化学习和蒙特卡洛树搜索策略,提高了定理证明的效率和准确性。

开发利器

RAGChecker[9]

Image
https://github.com/amazon-science/RAGChecker

亚马逊 AWS AI 推出了开源工具 RAGChecker,专注于通过声明级别的蕴含性检查来对 RAG 系统进行细粒度评估和诊断。该工具不仅能为 RAG 系统提供全面评估,还能通过具体的诊断指标帮助开发者针对性地优化系统性能。

LLM-Aided OCR[10]

Image

LLM-Aided OCR 利用先进的自然语言处理技术和大语言模型(LLM),将 OCR 识别的文本转化为高精度、格式良好且易于阅读的文档。支持本地 LLM 和云端 API 处理,提供 PDF 转图片、智能文本分块、Markdown 格式化等功能,并支持异步处理和 GPU 加速。进一步提升了 OCR 的识别质量。

nano-GraphRAG[11]

nano-GraphRAG是GraphRAG的轻量级实现。相比官方版本,它更小、更快、更易于阅读和修改,仅约800行代码,但保留了核心功能。支持异步操作并完全类型化,适合需要灵活和高效解决方案的开发者。

大模型 benchmark 集合[12]

Image

文章-观点

我没有大模型经验,可以给个机会吗[13]

本期周刊标题来源,知乎高赞,建议跳转原文阅读。https://zhuanlan.zhihu.com/p/715031517

To Code, or Not To Code ?[14]

最新研究表明,将代码数据纳入预训练,即使不是专门为代码设计的模型,也能显著提升LLM在非代码任务中的表现。相比纯文本预训练,添加代码数据可提升自然语言推理能力 8.2%,提升世界知识 4.2%,生成胜率提高 6.6%,代码性能更是提升了 12 倍!

LLMs 的幻觉[15]

对于固定的数据集,更大、训练更长时间的 LMs 产生的幻觉更少。同时,随着 LMs 的规模增加,其幻觉的可检测性也在降低。

增强大型语言模型的鲁棒性[16]

研究人员发现,尽管大型语言模型(LLMs)在复杂推理任务中表现出色,但当问题描述包含不相关信息时,即使使用先进的提示技术,这些模型的推理能力也会显著降低。尽管 LLMs 能够识别不相关信息,但一旦识别出来,却无法有效减轻这些信息造成的干扰。

为了解决这个问题,研究者们提出了一种新的自动构建方法 ATF(Automatic Transformation of Filtering),该方法通过从上下文中“提示出”不相关的信息,可以增强 LLM 的稳健性。这个过程可以被看作是一种自我缓解机制,首先识别出上下文中的不相关信息,然后将其过滤掉,从而提高模型推理的准确性和可靠性。

AI 产品

Napkin AI[17]

Image

Napkin AI 是一个将文本内容转换为视觉图像的工具,旨在通过生成图表、流程图等视觉元素来加速和提高业务故事讲述的效果。

使用 Napkin AI 的过程包括粘贴文本、生成相关视觉内容、编辑和个性化设计元素(如图标、装饰元素、连接线、颜色和字体),以及将最终的视觉内容导出为 PNG、PDF 或 SVG 格式,以便在不同的场景中使用,如演示文稿、博客、社交媒体和文档。Napkin AI 的使用案例包括自动生成的信息图表、图表、流程图等。

Sparkle[18]

Image

Sparkle 是一款专为 Mac 用户设计的自动文件整理工具,利用人工智能技术帮助用户自动化地组织和管理 Downloads、Desktop 和 Documents 文件夹中的文件。

Ellipsis.dev[19]

Image

Ellipsis.dev 是一个为开发者提供自动化代码审查和缺陷修复的 AI 工具,它能够在拉取请求时自动识别代码逻辑错误、反模式和风格指南违规,支持超过 20 种编程语言。

Kraftful[20]

Image

Kraftful 是一个专为产品团队设计的 AI 平台,它能够快速分析来自多个渠道的用户反馈,包括评论、调查、通话和支持票据,以提供深入洞察,帮助产品团队了解用户需求并提高效率。

参考资料
[1]

KVQuant: https://arxiv.org/abs/2401.18079

[2]

xRAG: https://arxiv.org/abs/2405.13792

[3]

Multi-Meta-RAG: https://arxiv.org/abs/2406.13213

[4]

Meta Agent Search: https://arxiv.org/abs/2408.08435

[5]

SysBench: https://arxiv.org/abs/2408.10943

[6]

视觉驱动文档检索: https://blog.vespa.ai/the-rise-of-vision-driven-document-retrieval-for-rag/

[7]

mPLUG-Owl3: https://huggingface.co/spaces/mPLUG/mPLUG-Owl3

[8]

DeepSeek-Prover-V1.5: https://github.com/deepseek-ai/DeepSeek-Prover-V1.5

[9]

RAGChecker: https://github.com/amazon-science/RAGChecker

[10]

LLM-Aided OCR: https://github.com/Dicklesworthstone/llm_aided_ocr

[11]

nano-GraphRAG: https://github.com/gusye1234/nano-graphrag

[12]

大模型benchmark集合: https://huggingface.co/collections/open-llm-leaderboard/the-big-benchmarks-collection-64faca6335a7fc7d4ffe974a

[13]

我没有大模型经验,可以给个机会吗: https://zhuanlan.zhihu.com/p/715031517

[14]

To Code, or Not To Code ?: https://arxiv.org/abs/2408.10914

[15]

LLMs 的幻觉: https://x.com/rohanpaul_ai/status/1825323166929141912

[16]

增强大型语言模型的鲁棒性: https://www.arxiv.org/abs/2408.10615

[17]

Napkin AI: https://www.napkin.ai/

[18]

Sparkle: https://makeitsparkle.co/

[19]

Ellipsis.dev: https://www.ellipsis.dev/

[20]

Kraftful: https://www.kraftful.com/