AI 开发者周刊#008:Mini-Omni、完全开源的MoE、大模型和小模型...
这里分享对开发者有用的人工智能技术和信息,每周五发布。
Mini-Omni[1]
Mini-Omni 是由Hugging Face 开发的开创性开源语言模型,具备实时端到端语音输入和流式音频输出的对话能力,支持实时语音对话,无需额外的自动语音识别(ASR)或文本到语音(TTS)模型 。该模型提供了类似人类对话模式的功能,能够在“思考”时进行语音生成。
完全开源的MoE模型[2]
OLMoE 是首个完全开源(包括模型权重、训练数据、代码和日志)的采用稀疏混合专家(Mixture-of-Experts, MoE)的语言模型,该模型具有 70 亿个参数,但每个输入tokens只使用 10 亿个参数。该模型在 5 万亿个tokens上进行预训练,模型性能超越了 Llama2-13B-Chat 和 DeepSeekMoE-16B。
rerankers[3]
rerankers 是一个开源项目,旨在提供一个简单的 API 来使用所有常见的重排模型。该项目支持多种类型的重排器,包括标准的 SentenceTransformer 或 Transformers 交叉编码器、RankGPT、T5 Seq2Seq 重排器、Cohere、Jina、Voyage 和 MixedBread API 重排器、FlashRank 重排器以及基于 ColBERT 的重排器。
ControlFlow[4]
ControlFlow 是一个用于构建智能代理的 AI 工作流 Python 框架。它提供了一个结构化、面向开发者的框架,用于定义工作流并将工作委托给 LLM,而不会牺牲控制力或透明度。
continuous-eval[5]
continuous-eval 是一个开源软件包,用于评估基于 LLM 的应用程序。它提供了一个模块化的评估框架,涵盖了 RAG、代码生成、代理工具使用、分类等多种 LLM 使用场景。该框架支持使用确定性、语义和基于 LLM 的指标进行评估。此外,它还提供了合成数据集生成功能,用于测试评估管道。
ReNeLLM[6]
ReNeLLM 是针对 LLM 的通用越狱提示攻击框架,它将越狱提示攻击概括为提示重写和场景嵌套两个方面,利用 LLM 本身生成越狱攻击提示。
TinyAgent[7]
TinyAgent 是一个针对边缘计算设备的端到端框架,用于训练和部署小型语言模型代理。
groq-moa[8]
此 Streamlit 应用程序展示了 Together AI 提出的混合代理架构,由 Groq LLMs提供支持。它允许用户与可配置的多代理系统交互。
大模型和小模型[9]
同源小模型的研究价值:在相同的tokenizer和训练数据下,小模型可以通过实验快速验证大模型的性能,尤其是在预训练和后续训练阶段。小模型的快速迭代能力使其成为大模型实验的理想场所。
Scaling Law:小模型的性能可以预测大模型的表现,因此在同源小模型上进行实验可以减少大模型的实验成本和时间。
模型蒸馏:通过大模型对小模型进行蒸馏,使小模型继承大模型的知识,从而提升其性能。此外,利用大模型作为小模型的reward model,可以更准确地评估小模型的表现,尤其是在对齐阶段。
大模型的辅助作用:大模型不仅是小模型的天花板,还能在训练过程中帮助小模型。例如,通过模型蒸馏和reward model来提升小模型的性能。
小模型在实际应用中的作用:在大模型的训练和部署过程中,小模型发挥了重要作用,如数据质量分类、领域数据分类、在线分类器、信息检索模型(RAG)、以及数据生成模型等。
在回答之前重复问题[10]
只需添加“在回答之前重复问题”就能使模型正确回答问题。
可能的解释是:
在模型的上下文中重复问题,显着增加模型检测到任何潜在“陷阱”的可能性。 一种假设是,它可能会将模型置于更多的完成模式中,而不是从聊天指令模式中进行应答。 另一个虽然不太可能的原因可能是模型可能假设用户的问题包含错误(例如,用户打算询问薛定谔猫而不是死猫)。然而,如果问题是在上下文中助理的部分,则模型相信它是准确的。
从头开始构建LLMs[11]
如果你想在本周末花几个小时深入研究大型语言模型 ( LLMs ) 并了解它们的工作原理,一定不要错过这个关于实施、训练和使用 LLMs 的 3 小时编码研讨会演示。
微软正尝试在Office中集成国产开源大模型RWKV[12]
用户在最新 Windows 11 的 Office 文件夹中发现以 RWKV 命名的 DLL 文件,反编译后确认其为 RWKV.cpp 的变体。网友对此议论纷纷,呼吁微软提供支持和报酬。
RWKV 团队推测微软可能将其用于本地 Copilot 和 memory recall 功能。RWKV 的优势包括支持100多种语言、低能耗,适合在不同设备上运行。RWKV 模型在生成更多 token 时的计算资源需求呈线性增加,GPU 能耗更为高效,适用于延长设备电池寿命。
MIT开发新工具帮助甄选合适的训练数据集[13]
为了训练更强大的大型语言模型(LLM),研究人员依赖于来自网络的海量数据集,但这些数据集的来源信息和使用限制常常在组合和重新组合中被忽略或混淆。这不仅带来法律和伦理问题,还可能影响模型性能。例如,错误分类的数据集可能导致不适合任务的数据被使用,数据中的偏见还可能导致不公平的预测。
MIT 和其他机构的研究团队审计了 1800 多个常见数据集,发现超过 70% 的数据集缺乏许可信息,约 50% 含有错误信息。基于此,他们开发了“数据来源探索器”工具,帮助自动生成数据集的来源、许可等信息,旨在提升 AI 模型的透明性和性能。
研究指出透明的数据来源对模型的可靠性至关重要,尤其是涉及特定任务的微调数据集。在众包平台上,数据集的原始许可信息常被忽视,可能导致开发者因数据集许可问题而被迫下架模型。研究团队通过系统审计和反向追溯,减少了“未指明”许可数据集的比例。
Mini-Omni: https://huggingface.co/gpt-omni/mini-omni
[2]完全开源的MoE模型: http://arxiv.org/abs/2409.02060v1
[3]rerankers: https://github.com/answerdotai/rerankers
[4]ControlFlow: https://github.com/PrefectHQ/ControlFlow
[5]continuous-eval: https://github.com/relari-ai/continuous-eval
[6]ReNeLLM: https://github.com/NJUNLP/ReNeLLM
[7]TinyAgent: http://arxiv.org/abs/2409.00608v1
[8]groq-moa: https://github.com/skapadia3214/groq-moa
[9]大模型和小模型: https://zhuanlan.zhihu.com/p/714399961
[10]在回答之前重复问题: https://x.com/rohanpaul_ai/status/1830230678673223737
[11]从头开始构建LLMs: https://www.youtube.com/watch?v=quh7z1q7-uc
[12]微软正尝试在Office中集成国产开源大模型RWKV: https://mp.weixin.qq.com/s/x0HoJpsW3Wci3lI7TZU1YQ
[13]MIT开发新工具帮助甄选合适的训练数据集: https://mp.weixin.qq.com/s/qTYIQLkVVA-FHJXzX2DvYQ