科研助手 Agent 需求分析
开篇词
智能 Agent 的落地,归根结底仍然离不开对用户场景的深入理解。无论技术如何演进,需求分析始终是构建有效系统的核心环节。这一点,与传统软件工程中的需求分析并无本质区别。
本文旨在通过笔者自身的一些科研与实践经验,借助大语言模型的能力,逐步完善出一份以真实场景为基础的智能 Agent 需求文档。文中将包含多个具体用例,力求在逻辑上自洽、在业务上可落地,从而帮助读者理解如何将智能 Agent 技术融入实际问题解决中。
本文的目的并非提供标准答案,而是抛砖引玉——希望在当前“智能体热潮”中,大家在追求自动化与智能化的同时,仍能回到软件工程的本源,重视场景建模与需求分析这一基础性工作。只有理解“为谁而建、为何而建”,智能 Agent 才能真正“落地生根”。
1. 目标与范围
1.1 核心目标
面向研究者的全生命周期智能助手:构建覆盖科研全流程的 AI Agent 系统,从研究发现、选题论证、规划设计、实验执行、写作投稿、传播推广到成果复盘的完整闭环支持。
强调可验证与可追溯性:建立完整的证据链体系,包括来源标注、引用一致性检查、数据与代码血缘管理、实验可重现性验证,确保研究过程的透明度和可信度。
提供智能化闭环能力:通过 AI 技术实现选题评估与优化、实验设计与编排、写作质量提升、投稿策略制定、审稿意见分析与回复生成等核心功能的自动化和智能化。
1.2 系统范围
功能覆盖范围:
• 研究前期:文献调研、知识图谱构建、研究问题识别、选题评估、技术路线设计 • 研究中期:实验设计、数据收集、结果分析、进度管理、风险控制 • 研究后期:论文写作、期刊匹配、投稿管理、审稿应答、成果传播 • 全程支持:项目管理、团队协作、知识管理、合规检查、影响力追踪
用户群体范围:
• 学术研究者:硕博研究生、博士后、青年教师、资深学者、跨学科研究团队 • 产业研究员:企业 R&D 人员、技术专家、创新团队、产学研合作项目 • 支持角色:导师、项目经理、研究助理、图书馆员、期刊编辑
技术边界范围:
• 输入处理:多模态文档解析(PDF、图像、表格)、音视频转录、结构化数据导入 • 知识处理:自然语言理解、知识抽取、推理计算、多语言支持 • 输出生成:文本生成、图表制作、报告编写、可视化展示 • 集成能力:外部数据源接入、第三方工具集成、API 服务调用
1.3 价值主张
1. 效率提升:通过自动化和智能化减少重复性工作,将研究者从繁琐的事务性任务中解放出来,专注于创新性思考和核心研究工作。 2. 质量保障:基于大数据和 AI 算法提供客观的评估和建议,减少主观偏见,提高研究设计的科学性和论文写作的规范性。 3. 知识增值:通过知识图谱和智能推荐发现潜在的研究机会和合作可能,促进跨学科融合和创新突破。 4. 风险控制:提供全程的风险识别和预警机制,帮助研究者及时发现和解决问题,提高项目成功率。
1.1 用户画像与角色
1.1.1 主要用户群体
研究人员(核心用户):
• 新手研究者(硕士生、博士一年级):需要选题指导、文献梳理、基础方法学习。 • 进阶研究者(博士高年级、博后):关注创新点挖掘、实验设计、写作投稿。 • 资深研究者(PI*、教授):重视项目规划、团队协作、影响力追踪。 • 跨学科研究者:需要多领域知识整合、术语对照、方法迁移。 • 产业研究员:关注技术转化、专利布局、市场应用。
PI(Principal Investigator,首席研究员)是科研项目的主要负责人和学术带头人,通常是具有博士学位和丰富研究经验的教授或副教授级别研究人员。PI 对整个研究项目承担主要的科学和行政责任,包括制定研究方向、管理团队、申请资金、确保研究质量和合规性等。在本文档中,PI 与教授并列提及,体现了这类用户既有学术职位又承担项目领导责任的双重角色特点。
支持角色:
• 数据/工程支持:数据处理、复现环境与实验编排的技术辅助者。 • 管理与合规角色:IRB/伦理审查、版权许可与开源策略把关者。 • 图书馆员/信息专员:文献资源管理、检索策略优化。
1.1.2 使用场景分类
• 个人研究:独立完成的小型研究项目。 • 团队协作:多人参与的大型项目,需要任务分工与进度协调。 • 跨机构合作:涉及多个机构的联合研究。 • 产学研结合:学术研究与产业应用的结合项目。
1.2 边界与假设
1.2.1 技术边界
• 语言支持:初期以中英文为主,逐步扩展到其他主要学术语言。 • 学科覆盖:优先支持计算机科学、工程技术、生物医学,逐步扩展到社会科学、人文学科。 • 研究类型:支持实证研究、理论研究、综述研究、方法学研究。 • 数据范围:初期专注公开学术与开源资源;涉密数据需企业自有合规网关。
1.2.2 功能边界
• 辅助定位:输出为辅助与建议,不替代研究者的原创与判断;所有结论需可验证。 • 质量保证:对外部源的可用性与质量存在波动,系统提供来源与置信度标注。 • 伦理合规:严格遵循学术诚信,不生成虚假数据或引用,所有内容可追溯。
1.2.3 使用假设
• 用户具备基本的学术研究素养和计算机操作能力。 • 用户能够对系统输出进行批判性评估和验证。 • 用户遵循所在机构和领域的学术规范与伦理要求。
1.3 典型用例概览(跨章节闭环)
1.3.1 核心闭环场景
• 闭环场景-1 文献聚合 → 选题评分 → 研究提案摘要 • 涉及用例:UC-2.1-1(多源文献检索与聚合)→ UC-2.2-1(选题评分与优先排序)→ UC-2.3-1(实验设计助手与功效分析) • 适用场景:新研究项目启动、课题申请准备 • 预期收益:提高选题质量,降低重复研究风险 • 使用频次:中频(每月 1-3 次) • 闭环场景-2 研究图谱 → 空白区识别 → 个性化选题推荐 • 涉及用例:UC-2.1-2(研究图谱构建与空白区识别)→ UC-2.2-1(选题评分与优先排序)→ UC-2.2-6(跨学科融合机会识别) • 适用场景:寻找创新点、确定研究方向 • 预期收益:发现研究机会,提升创新性 • 使用频次:低频(每季度 1-2 次) • 闭环场景-3 写作提纲 → 相关工作对齐 → 实验设计联动 • 涉及用例:UC-2.5-2(章节助手与相关工作对齐)→ UC-2.5-3(引用可验证性与反幻觉校验)→ UC-2.3-1(实验设计助手与功效分析) • 适用场景:论文写作、实验规划 • 预期收益:提高写作效率,确保逻辑一致性 • 使用频次:高频(每周 2-5 次) • 闭环场景-4 专利差异化分析 → 权利要求草案 → 许可策略 • 涉及用例:UC-2.2-2(专利先验检索与差异化分析)→ UC-2.7-1(专利景观分析与申请策略)→ UC-2.6-2(知识产权与转化评估) • 适用场景:技术转化、知识产权保护 • 预期收益:降低侵权风险,优化专利布局 • 使用频次:低频(按需使用)
1.3.2 扩展场景
• 多学科研究整合:跨领域文献整合、术语对照、方法迁移 • 产业化转化支持:技术成熟度评估、市场分析、商业化路径 • 国际合作促进:合作伙伴匹配、文化差异提醒、沟通模板 • 教学科研结合:课程设计、案例开发、学生指导
2. 全生命周期场景
2.1 发现与研读(Research Discovery & Reading)
数据源与 API 限制:
• arXiv:通过 arXiv API 获取,每日调用限制 1000 次,支持 CS/Physics/Math 等学科,更新频率日更新 • Semantic Scholar:免费 API,每月限制 5000 次调用,提供引用图谱和作者档案,更新频率周更新 • PubMed:通过 NCBI E-utilities,无需 API key 但需遵守使用条款,医学文献为主,日更新 • OpenAlex:开源学术图谱,API 调用限制宽松,支持复杂查询,月更新核心数据 • Crossref:DOI 注册机构,免费 API 限制 50 次/分钟,提供元数据和引用关系,实时更新 • CNKI/万方:需机构订阅,中文文献为主,通过图书馆代理访问,更新频率各异
技术实现架构:
• 数据获取层:RESTful API 调用、RSS 订阅、OAI-PMH 协议、机构代理访问 • 数据标准化:统一元数据格式(标题、作者、摘要、关键词、引用),处理编码和格式差异 • 质量控制:基于影响因子、引用次数、出版源的信誉评分,过滤掠夺性期刊 • 去重算法:相似度计算(标题>80% + 作者>60%),DOI 匹配优先,机器学习辅助去重 • 缓存机制:Redis 缓存热点数据,本地数据库存储历史数据,增量更新策略
核心功能模块:
• 文献检索与聚合:多源整合、智能去重、质量过滤、相关性排序 • 研究图谱增强:作者-机构-资助-合著-引用网络、主题演化与冷热点、空白区识别、成熟度与 SOTA 映射 • 书目与引用管理:自动抽取 BibTeX、去重、引用风格转换(IEEE / ACM / APA 等)、参考文献一致性检查 • 数据与代码追踪:Papers with Code / GitHub 关联、复现难度与活跃度评估、仓库质量评分
2.1.1 UC-2.1-1 多源文献检索与聚合
• 触发:用户输入主题/关键词与时间范围。 • 输入:关键词、起止年份、源选择、语言过滤、相关性阈值。 • 步骤:跨源检索 → 去重合并 → 质量/相关性打分 → 生成证据链。 • 输出:排序后的文献列表(来源、摘要、链接、评分、BibTeX)。 • 异常处理: • 数据源不可用:自动切换备用源或提供离线缓存 • 网络超时:设置重试机制,最大重试 3 次 • 结果为空:扩大关键词范围或降低相关性阈值 • 重复率过高:优化去重算法,人工审核边界案例 • 边界条件: • 关键词长度:最少 2 个字符,最多 200 个字符 • 时间范围:最早支持 1900 年,最晚支持当前年份 • 单次返回量:最多 1000 条文献,超过时分页处理 • 成功标准:相关文献召回率 >85%,重复率 <5%,来源可追溯性 100%。 • 业务价值:节省 60-80% 文献搜集时间,提高文献质量。
2.1.2 UC-2.1-2 研究图谱构建与空白区识别
• 触发:用户选择领域或初始文献集。 • 输入:作者/机构/引用关系、主题标签、时间线、最小样本阈值。 • 步骤:实体抽取 → 图构建 → 社区/演化分析 → 空白区与 SOTA 映射。 • 输出:图谱视图、热点/冷点列表、潜在突破点建议、置信度评分。 • 异常处理: • 数据稀疏:当节点数<50 或边数<100 时,提示样本不足并建议扩展数据集 • 图谱断裂:识别孤立子图,提供连通性分析和连接建议 • 空白区误判:结合时序分析,区分真正空白与新兴研究方向 • 算法失效:提供多种社区发现算法备选(Louvain、Infomap、Label Propagation) • 边界条件: • 时间窗口:最少需要 3 年数据,建议 5 年以上数据 • 文献数量:最少 100 篇高质量文献,推荐 500 篇以上 • 领域范围:支持单一学科和跨学科分析,跨学科最多 5 个领域 • 注意:避免将数据稀疏误判为空白;标注置信度与样本覆盖率;跨学科研究需要更大样本量。 • 成功标准:空白区识别准确率 >75%,热点预测精确率 >70%,图谱连通性 >90%。 • 业务价值:发现研究机会,避免重复研究,提升创新性。
2.1.3 UC-2.1-3 引用一致性校验与书目管理
• 触发:用户导入参考文献列表(Bib/书目)。 • 步骤:元数据补全 → 风格转换 → 重复/缺失项校验 → 一致性检查。 • 输出:规范化书目、差异报告、修复建议。 • 成功标准:无重复、风格正确、与正文引用一致。 • 业务价值:减少投稿被拒风险,提高论文规范性。
2.1.4 UC-2.1-4 跨语言文献整合与翻译辅助
• 触发:用户需要整合多语言文献资源。 • 输入:多语言关键词、目标语言、专业术语词典。 • 步骤:多语言检索 → 术语对照 → 摘要翻译 → 质量评估。 • 输出:多语言文献库、术语对照表、翻译质量评分。 • 成功标准:术语翻译准确率 >90%,覆盖主要学术语言。 • 业务价值:扩大文献覆盖面,促进国际学术交流。
2.1.5 UC-2.1-5 学术争议与观点分析
• 触发:用户关注某个有争议的研究话题。 • 输入:争议话题、时间范围、观点分类标准。 • 步骤:观点抽取 → 立场分类 → 证据强度评估 → 争议演化分析。 • 输出:争议地图、观点对比表、证据强度评分、发展趋势。 • 成功标准:观点分类准确率 >85%,争议点识别完整。 • 业务价值:帮助研究者理解学术争议,选择合适的研究立场。
2.2 选题与论证(Topic Selection & Justification)
• 选题评分与优先级:新颖度、影响力、可行性、数据可得性、算力与成本、时间窗口综合评分。 • 先验艺术/专利检索:Google Patents / USPTO / WIPO / CNIPA 检索,侵权风险与差异化分析。 • 风险清单与缓解策略:技术、数据、伦理、合规、资源与依赖的风险识别与缓解方案。 • 合作建议与专家图谱:潜在合作者/导师/审稿人画像与冲突回避提示。
2.2.1 UC-2.2-1 选题评分与优先排序
• 输入:候选选题、约束(资源/时间/数据可得性)、评估维度权重、历史成功案例。 • 步骤:指标计算 → 多目标加权 → 可行性与窗口评估 → 排序 → 置信度评估。 • 输出:评分表、优先级队列、建议取舍与理由、置信度评分、风险提示。 • 异常处理: • 数据不足:当可用文献<20 篇或专利<10 件时,提示数据稀疏风险 • 指标冲突:新颖度高但可行性低的选题,提供权衡建议 • 时效性问题:热点领域快速变化时,提供时效性警告 • 边界条件: • 评估维度:支持 5-10 个评估维度,权重总和为 100% • 历史数据:需要至少 50 个历史项目数据训练评估模型 • 时间窗口:考虑 1-3 年的技术发展趋势和市场需求 • 成功标准:评分一致性 >75%(与专家评估),高风险识别准确率 >85%,排序合理性 >80%。 • 业务价值:提高选题成功率 30-40%,优化资源配置,降低研究失败风险。
2.2.2 UC-2.2-2 专利先验检索与差异化分析
• 输入:技术关键词、同义词、IPC 分类码。 • 步骤:跨库检索 → 家庭/法律状态聚合 → 近似文本比对 → 差异点挖掘。 • 输出:相关专利清单、重叠风险、差异化建议。 • 注意:法律解释需标注非法律建议,给出来源与更新日期。 • 成功标准:专利覆盖率 >95%,风险评估准确率 >85%。 • 业务价值:降低专利侵权风险,指导技术创新方向。
2.2.3 UC-2.2-3 合作建议与冲突回避
• 输入:目标方向、机构偏好、排除名单。 • 步骤:专家画像 → 合作网络 → 潜在审稿冲突 → 推荐列表。 • 输出:合作建议、人脉图谱、冲突提示与回避建议。 • 成功标准:合作匹配度 >80%,冲突识别准确率 >90%。 • 业务价值:促进有效合作,避免审稿冲突。
2.2.4 UC-2.2-4 研究时机判断与窗口分析
• 触发:用户考虑某个研究方向的进入时机。 • 输入:研究主题、技术成熟度、市场需求、政策环境。 • 步骤:趋势分析 → 竞争态势评估 → 技术成熟度评估 → 时机评分。 • 输出:时机评分、最佳进入窗口、风险与机会分析。 • 成功标准:时机预测准确率 >70%,窗口识别及时性 >85%。 • 业务价值:把握研究时机,提高成果影响力。
2.2.5 UC-2.2-5 社会影响与伦理评估
• 触发:用户需要评估研究的社会影响和伦理风险。 • 输入:研究内容、应用场景、潜在影响群体、伦理框架。 • 步骤:影响分析 → 伦理风险识别 → 缓解措施建议 → 合规检查。 • 输出:影响评估报告、伦理风险清单、缓解措施、合规建议。 • 成功标准:风险识别完整率 >90%,缓解措施可行性 >80%。 • 业务价值:确保研究合规,提升社会责任感。
2.2.6 UC-2.2-6 跨学科融合机会识别
• 触发:用户寻找跨学科研究机会。 • 输入:主要学科、相关学科、研究问题、方法偏好。 • 步骤:学科交叉分析 → 方法迁移评估 → 合作机会识别 → 融合路径设计。 • 输出:融合机会清单、方法迁移建议、合作伙伴推荐、实施路径。 • 成功标准:机会识别准确率 >75%,方法迁移可行性 >70%。 • 业务价值:促进学科交叉创新,拓展研究视野。
2.3 规划与资源(Planning & Resources)
• 方法路线图:问题分解、候选方法、评测指标、基线与对照设定。 • 实验设计助手:变量控制、样本量与功效分析、Ablation 计划、随机化与偏倚控制。 • 数据管理计划(DMP):采集、清洗、标注、版本与血缘、开放数据策略与发布计划。 • 伦理与合规:IRB / 隐私 / GDPR / 生物安全 / 医疗合规模板与检查清单。 • 资源与预算:GPU / 云资源选择、成本估算与排程,成果产出甘特图与里程碑规划。
2.3.1 UC-2.3-1 实验设计助手与功效分析
• 输入:效应量预估(基于先导实验或文献)、显著性阈值(默认 α=0.05)、统计功效目标(默认 1-β=0.80)、变量与对照设置、资源约束。 • 步骤:效应量验证 → 样本量计算 → 随机化方案设计 → 盲法建议 → Ablation 计划 → 统计分析方法选择 → 敏感性分析。 • 输出:实验设计蓝图、样本量建议、统计检验方案、随机化方案、风险与依赖项、效应量追踪计划。 • 异常处理: • 效应量不确定:提供样本量范围建议(最小/最大/推荐) • 资源不足:提供折衷方案(如序贯设计、自适应设计) • 复杂多因素实验:推荐分层设计或正交设计 • 非正态数据:提供非参数检验替代方案 • 边界条件: • 样本量上限:考虑实际资源限制,提供可行性评估 • 最小效应量:基于科学意义设定,不盲目追求统计显著性 • 多重比较:自动应用 Bonferroni 或 FDR 校正 • 成功标准:统计功效达到预设目标(通常 ≥80%),样本量计算准确性 >90%,设计可行性 >95%。 • 业务价值:减少样本量浪费 30-50%,提高实验成功率 25-35%,避免重复实验成本。
2.3.2 UC-2.3-2 DMP 生成与版本血缘管理
• 步骤:数据来源登记 → 处理流程 → 版本策略 → 血缘与发布策略。 • 输出:DMP 文档、数据字典、版本/血缘图谱与合规清单。 • 成功标准:数据血缘完整率 >95%,合规检查通过率 >90%。 • 业务价值:确保数据可追溯,满足开放科学要求。
2.3.3 UC-2.3-3 资源排程与预算评估
• 输入:实验矩阵、资源选项(GPU/云)、时间窗口。 • 步骤:成本估算 → 排程模拟 → 风险缓冲 → 里程碑设置。 • 输出:预算与排程计划、甘特图、超支预警阈值。 • 成功标准:成本预估误差 <15%,进度预测准确率 >80%。 • 业务价值:优化资源利用,控制项目成本。
2.3.4 UC-2.3-4 多方案比较与决策支持
• 触发:用户面临多个技术方案选择。 • 输入:候选方案、评估维度、权重设置、约束条件。 • 步骤:方案建模 → 多维度评估 → 敏感性分析 → 决策建议。 • 输出:方案对比表、决策矩阵、风险分析、推荐方案。 • 成功标准:方案评估准确率 >85%,决策满意度 >80%。 • 业务价值:提高决策质量,减少方案选择风险。
2.4 执行与实验(Execution & Experimentation)
实验工具链集成:
• MLflow:开源实验追踪,支持多种 ML 框架,本地/云端部署,API 限制宽松 • Weights & Biases (W&B):商业化实验管理,免费版有限制,强大的可视化能力 • TensorBoard:TensorFlow 生态,轻量级,适合深度学习实验 • Sacred:Python 实验管理,代码侵入性小,支持 MongoDB 后端 • DVC (Data Version Control):数据版本控制,与 Git 集成,支持大数据集
容器化与复现环境:
• Docker:标准化环境,支持 GPU 加速,镜像分层存储,版本管理 • Conda:Python 环境管理,跨平台,丰富的科学计算包 • Poetry:Python 依赖管理,精确的版本锁定,更好的依赖解析 • Pipenv:Pipfile 替代 requirements.txt,自动生成锁定文件