AI 开发者周刊#001:Eureka Labs、Qwen2技术报告、GraphRAG
这里分享对开发者有用的人工智能技术和信息,每周五发布。
Eureka Labs:新型AI学校[1]
曾任Tesla人工智能总监,也是OpenAI创始团队成员的Andrej Karpathy宣布将创办一家名为Eureka Labs的新型学校。学校以AI为基础,通过构建具有教师+AI共生关系的平台,让任何人都能够获得理想的知识学习体验。
其首秀课程LLM101n大纲放出,课程还未发布就已获得22k Star。
Qwen2技术报告[2]
阿里发布了Qwen 2的技术报告。Qwen2系列是一套全面的基础和指令调整语言模型,涵盖了从0.5到720亿的参数范围,包括密集模型和混合专家模型。报告介绍了该系列模型的模型架构、大致训练过程以及系列模型的测试结果。
GraphRAG[3]
GraphRAG是一种基于AI的内容解释和搜索功能。它使用LLM解析数据以创建知识图谱并回答用户关于私有数据集的问题。
GraphRAG能够将大量信息连接起来,并利用这些连接来回答那些使用关键字和基于向量的搜索机制难以回答或无法回答的问题。使用GraphRAG的系统能够回答答案涵盖许多文档的问题以及主题问题,例如“此数据集中的热门主题是什么?”。
Neo4j的CTO写了一篇详细的文章通俗易懂地介绍了GraphRAG的原理、与传统 RAG的区别、GraphRAG的优势、知识图谱的创建和利用知识图谱工作。值得阅读。
大模型横评网站[4]
该网站集合了主流大模型的API免费提供给用户使用,参考了LMSYS Chatbot Arena的ELO机制,没有固定的测试集,而是基于真实用户反馈来给大模型排名。这就大大降低了模型作弊刷榜的可能。
作者戏称自己的榜单为“大模型野榜”,刚开始可能不准确,但随着点评的人越多相信榜单也会越靠谱。
面对9.11和9.9,大模型集体翻车
小学二年级都会的“9.11和9.9哪个更大?”,国内外大模型集体翻车。
至于为什么集体翻车,有人说是软件版本号、书籍目录等概念里9.11比9.9大,大模型在训练数据里见这种见得太多,而手把手教基础算数的数据很少。
但更有说服力的说法是,大模型以token的方式来理解文字,当9.11被拆成“9”、“.”和“11”三部分时,11确实比9大。
但在适当提示下,模型还是能回答正确的:
因此,合适的prompt对LLM还是很重要的。
Sonnet 3.5 系统提示词[5]
Claude Sonnet 3.5 用于编程任务的系统提示词在raddit上爆火,提示词以思维链的方式提示LLM进行代码审查、规划、输出以及安全审查,值得LLM开发者和Prompt工程师学习。
Mistral NeMo:Mistral.ai推出的最小模型[6]
Mistral NeMo模型是Mistral.ai和NVIDIA合作开发的具有128k上下文长度的12B大小的模型。该模型擅长英语、法语、德语、西班牙语、意大利语、葡萄牙语、中文、日语、韩语、阿拉伯语和印地语。
Mistral NeMo使用基于Tiktoken的新标记器Tekken,该标记器已针对100多种语言进行训练,并且比以前的Mistral模型中使用的SentencePiece标记器更有效地压缩自然语言文本和源代码。与Llama3的标记器相比,Tekken在压缩大约85%语种的文本方面表现更为出色。
Eureka Labs: https://eurekalabs.ai/
[2]Qwen2技术报告: https://huggingface.co/papers/2407.10671
[3]GraphRAG: https://github.com/microsoft/graphrag
[4]大模型横评网站: https://lyihub.com/
[5]Sonnet 3.5 系统提示词: https://www.reddit.com/r/ClaudeAI/comments/1e39tvj/sonnet_35_coding_system_prompt_v2_with_explainer/
[6]Mistral NeMo: https://mistral.ai/news/mistral-nemo/