更强大的 UltraRAG 开源了!便捷搭建知识库,支持多模态!
UltraRAG 2.1 在这些科研挑战的背景下,进行了面向实际研究需求的全面升级。本次更新围绕 原生多模态支持、知识接入与语料构建自动化、统一构建与评估的 RAG 工作流三大方向带来了核心增强:
原生多模态支持:统一 Retriever、Generation 与 Evaluation 模块,全面支持多模态检索与生成;新增 VisRAG Pipeline,实现从本地 PDF 建库到多模态检索与生成的完整闭环。
知识接入与语料构建自动化:支持多格式文档解析与分块建库,无缝集成 MinerU,轻松构建个人化知识库。
统一构建与评估的 RAG 工作流:适配多种检索与生成推理引擎,提供标准化的评估体系,支持全链路可视化分析,实现从模型调用到结果验证的统一流程。
🔗 代码仓库:
https://github.com/OpenBMB/UltraRAG
🔗 教程文档:
https://ultrarag.openbmb.cn/
🔗 开源数据集:
https://modelscope.cn/datasets/UltraRAG/UltraRAG_Benchmark
UltraRAG由清华大学 THUNLP 实验室、东北大学 NEUIR 实验室、OpenBMB 与 AI9Stars 联合推出,是首个基于 Model Context Protocol (MCP) 架构设计的 RAG 框架。研究者只需通过编写 YAML 文件,即可声明串行、循环与条件分支等逻辑,以极低代码量构建多阶段推理与检索生成系统。
👇点击链接,了解 UltraRAG 2.0 详情:
UltraRAG 2.0 重磅开源:50 行代码,实现高性能 RAG!
原生多模态支持
过去,多模态 RAG 往往需要依赖多套独立工具:文本任务与视觉任务分属不同流程,研究者需在特征提取、检索、生成和评估工具间来回切换,接口不统一、复现困难。
UltraRAG 2.1 对多模态 RAG 流程进行了系统化整合。所有核心 Server——Retriever、Generation 与 Evaluation——均已原生支持多模态任务,可灵活接入各种视觉、文本、或跨模态模型。研究者可在统一框架内自由编排属于自己的多模态 pipeline,无论是文档问答、图文检索,还是跨模态生成,都能以最小代价实现端到端联通。此外,框架内置的 Benchmark 覆盖视觉问答等多种任务,并提供统一的评估体系,方便研究者快速开展和对比多模态实验。
在此基础上,UltraRAG 2.1 引入 VisRAG Pipeline,实现从本地 PDF 建库到多模态检索与生成的完整闭环。该功能基于论文《VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents》的研究成果,论文提出了一个面向多模态文档的视觉增强检索生成框架,通过将文档图像信息(如图表、公式、版面结构)与文本内容联合建模,显著提升了模型在复杂科学文档中的内容理解与问答能力。UltraRAG 将这一方法集成,使研究者能够直接在真实 PDF 文档场景中复现 VisRAG 的实验过程,并进一步扩展多模态检索生成的研究与应用。
首个打通视觉文档检索与生成全链路的视觉RAG框架—— VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
🔗https://arxiv.org/abs/2410.10594
面向多图证据推理的视觉RAG升级版,实现跨图推理与更强事实一致性—— VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
🔗https://arxiv.org/abs/2510.09733
下面展示的是我们搭建的示例系统所生成的两个生成案例。
🌰 Case 1
《Attention is All You Need》论文咨询
📖 用户问题
我没太看懂论文中的表 4 ,帮我详细分析一下?
📖 生成结果
🌰 Case 2
《麦肯锡|生成式人工智能的经济潜力》报告分析
📖 用户问题
报告中提到,生成式 AI 最有潜力的企业职能有哪些?请结合图表和正文说明它们在组织生产力中的影响。
📖 生成结果
知识接入与语料构建自动化
在 RAG 开发过程中,面对不同来源的资料,开发者需要反复解析、清洗、分块。结果是,RAG 的构建过程往往被琐碎的工程细节拖慢,科研创新的空间反而被压缩。
UltraRAG 2.1 的 Corpus Server 让这一切变得简单。用户无需编写复杂脚本,就能一次性导入来自不同来源的语料——无论是 word 文档还是电子书与网页存档,都能被自动解析为统一的文本格式。在 PDF 解析方面,UltraRAG 无缝集成 MinerU,能够精确识别复杂版面与多栏结构,实现高保真文本还原。对于图文混排文件,还支持将 PDF 按页转换为图像,让视觉布局也能成为知识的一部分。在分块策略上,Corpus Server 提供了多粒度选择:支持词元级、句子级与自定义规则,既能精细控制语义边界,又能自然适配 Markdown 等结构化文本。
UltraRAG 知识建库流程
通过这一整套自动化流程,Corpus Server 将语料导入、解析与分块过程模块化,减少了手工脚本与格式适配工作,使知识库构建可以直接融入 RAG pipeline 的标准化流程中。
统一构建与评估的 RAG 工作流
“切块、索引、检索、生成、评估,每一步都要用不同的脚本,太繁琐了!”
“每改一次参数、换一个模型,是否又要重搭整条 pipeline?”
“当实验终于跑通后,评估结果又该怎样保持一致与可比?”
这些问题几乎是每个 RAG 研究者都经历过的烦恼。现有框架对检索、模型接入、评估的支持往往零散且不兼容,研究者不得不在不同工具之间反复切换,每一次修改都可能引发整条实验链路的重建。UltraRAG 2.1 的目标,就是让复杂的流程重新变得清晰而统一。
在检索层面,框架支持稀疏、稠密、混合与多模态检索,并兼容 Infinity、Sentence-Transformers、OpenAI 等多种后端引擎,研究者可以自由组合检索策略与模型,实现灵活的 pipeline 设计。在模型生成部分,UltraRAG 2.1 同时支持 vLLM 离线推理 与 Hugging Face 本地调试,并保持与 OpenAI 接口 完全兼容,使模型切换与部署无需修改代码。在评估环节,UltraRAG 构建了统一的 Evaluation Server,既能对生成结果计算 ACC、ROUGE 等指标,又支持对检索结果进行 TREC 评估与显著性分析。配合可视化的 Case Study UI,研究者可以直观地比较不同模型与策略的表现,让“调试”真正变成“理解”。
此外,UltraRAG 通过 YAML 配置驱动的工作流机制,实现了从数据导入到检索、生成与评估的全链路串联,研究者只需编写少量配置文件,即可快速定义和复现实验流程。
Case Study UI
共建下一代开放 RAG 科研生态
我们的愿景,是将 UltraRAG 一直致力打造成一个开放、协作、可复现的 RAG 科研社区:让每一位研究者都能在统一框架中,自由搭建、验证和分享自己的 RAG 实验。未来,我们将持续推进一系列功能升级与共建计划:
可视化界面:支持拖拽式定义 pipeline,实现参数配置与实验运行的可视化;
满血版 Deep Research:提供更强大的推理流程,支持多轮推理、动态检索与工具调用。
持续集成 benchmark 与基线:建立统一评测体系,推动科研成果的开放与可复现。
我们相信,优秀的科研工具应让创新更专注、更轻松。