AI 开发者周刊#003:元奖励机制、Ollama Tool、Gemma2-2B...
这里分享对开发者有用的人工智能技术和信息,每周五发布。
Meta-Rewarding Language Models[1]
Meta、UC伯克利、NYU共同提出元奖励语言模型,通过引入元级奖励(Meta-Rewarding)步骤,使得大型语言模型(LLMs)能够自我评判其判断能力,并利用这一反馈进一步提炼其评判技能,从而在没有人类监督的情况下提高模型的性能。
通过这种方法,研究人员观察到模型在 AlpacaEval 2 和 Arena-Hard 基准测试中的显著性能提升,Llama-3-8B-Instruct 模型的胜率从 22.9% 提高到 39.4%,以及从 20.6% 提高到 29.1%。
Ollama Tool Support[2]
Ollama 现在支持使用 Llama 3.1 等流行模型进行工具调用,这使得模型能够通过所谓的工具来回答问题,例如函数、API、网页浏览、代码解释器等。目前支持的开源模型包括 Llama 3.1、Mistral Nemo、Firefunction v2 和 Command-R +。
Gemma 2 2B[3]
Google 推出了 Gemma 2 2B 模型,该模型能够在手机、笔记本电脑、台式机等边缘设备上运行。
Gemma 2 2B在LMSYS Chatbot Arena排行榜上超过了GPT-3.5模型,甚至超越了Mixtral-8x7b。
Llama 3.1 模型能力解析[4]
HuggingFace发布的这篇文章分别从Llama 3.1 新特性、训练、推理、评估、工具调用等方面对模型能力和开发集成进行了详细介绍,同时也展示了如何使用 distilabel 生成合成数据。
OmniParser[5]:用于纯视觉 GUI Agent
来自微软的论文,介绍了 OmniParser,它是一个基于纯视觉的图形用户界面 (GUI) Agent 解析器。旨在通过解析用户界面截图,将其转换成结构化元素,从而显著提高 LLM (如 GPT-4V) 在生成精确界面操作动作方面的性能。
Cohere Prompt Tuner[6]
Cohere 推出了 Prompt Tuner,这是一款能够自动优化提示词的工具。
Prompt Tuner 使用可自定义的优化和评估循环,通过基于 LLM 的评估结果,迭代地优化提示词。该工具支持多种评估标准,如准确性、字符数量限制、输出限制为 JSON 格式、信息提取能力等。
Prompt Poet[7]
在 Character.AI,掌握提示工程的艺术和科学至关重要。依托于大量的用户服务经验,Character.AI开发了一种新的提示方法:Prompt Poet。
Prompt Poet 使用 Python f-strings 和包装器,支持 YAML 和 Jinja2 模板语言,使得提示的设计更加灵活和可组合。通过该工具可以实现从传统的 “提示工程” 向 “提示设计” 的转变,更高效、直观地设计和管理对话提示,提高用户与 AI 交互的效率和质量。
OpenDevin 技术报告[8]
Devin 的出世展示了大模型 Agent 的强大能力。很快,业界就出现了众多尝试复刻它的开源项目,其中 OpenDevin 最受人们关注。如今,OpenaDevin 团队发布了该工具的技术报告。
这篇报告展示了 OpenDevin 平台的强大功能和潜力。通过事件流架构、沙箱环境、丰富的代理技能库以及多代理协作机制,OpenDevin 使得构建能够执行复杂任务的 AI 代理变得更加简单和高效。报告还介绍了 OpenDevin 的评估框架,该框架支持多种基准测试,可以评估代理在各种任务上的表现,包括软件工程、网页浏览和杂项任务。
构建生成式 AI 平台[9]
这篇文章详细介绍了构建生成式 AI 平台的关键技术和实施策略,涵盖了从平台架构、上下文构建、检索技术到安全防护、风险管理和缓存策略等多个方面内容。
值得开发者和产品经理一看。
SGLang[10]
SGLang 是一个针对大型语言模型和视觉语言模型的快速服务框架。它通过共同设计后端运行时和前端语言,使与模型的交互更快、更可控。
值得关注的是,与TensorRT-LLM、vLLM 相比,使用 SGLang 可以提供更快的 Llama3 服务。
Maestro[11]:Netflix 的数据/机器学习工作流编排器
Maestro 是 Netflix 开源的一个水平可扩展的工作流编排器,旨在管理大规模数据/ML工作流,例如数据管道和机器学习模型训练管道。它监督工作流的整个生命周期,从开始到结束,包括重试、排队、任务分配给计算引擎等。用户可以将其业务逻辑打包成各种格式,例如 Docker 镜像、笔记本、bash 脚本、SQL、Python 等。与仅支持有向无环图 (DAG) 的传统工作流编排器不同,Maestro 支持无环和有环工作流,还包括多种可重用模式,包括 foreach 循环、子工作流和条件分支等。
opensearch-ai[12]:个性化 AI 搜索引擎
该项目类似 SearchGPT 、Perplexity,但其更注重个性化体验,会学习用户的浏览习惯,根据用户的兴趣进行个性化推荐。主要特点:
基于 Mem0 自动收集和检索记忆,让用户更容易找到想要的信息。 集成了 Shadcn UI 和 Cobe,提供美观易用的用户界面。 模型使用 GPT-4o-mini,进行搜索和内容生成。
完全用 AI 构建网站[13]
Riley Brown 记录了自己从零开始,通过与 AI 的互动,一步步构建了一个包含前端和后端的全功能网站的过程。通过向 Claude 3.5 提出要求,获取代码并在代码编辑器中粘贴运行。尽管视频时长1个小时,但真正开发花了近3个小时,作者表示这并非是一个教程,更像是一个挑战。尽管整个过程并不顺利,但很明显 AI 确实能降低没有代码经验的人构建网站的门槛。
Meta-Rewarding Language Models: https://arxiv.org/abs/2407.19594
[2]Ollama Tool Support: https://ollama.com/blog/tool-support
[3]Gemma 2 2B: https://huggingface.co/collections/google/gemma-2-2b-release-66a20f3796a2ff2a7c76f98f
[4]Llama 3.1 模型能力解析: https://huggingface.co/blog/zh/llama31
[5]OmniParser: https://huggingface.co/papers/2408.00203
[6]Cohere Prompt Tuner: "https://cohere.com/blog/intro-prompt-tuner"
[7]Prompt Poet: https://research.character.ai/prompt-design-at-character-ai/
[8]OpenDevin 技术报告: https://arxiv.org/abs/2407.16741
[9]构建生成式 AI 平台: https://baoyu.io/translations/generative-ai/building-a-generative-ai-platform
[10]SGLang: https://github.com/sgl-project/sglang
[11]Maestro: https://github.com/Netflix/maestro
[12]opensearch-ai: https://github.com/supermemoryai/opensearch-ai
[13]完全用AI构建网站: https://x.com/rileybrown_ai/status/1817722679840940539