Geek Savvy

大语言模型的演变丨从知识密集型 NLP 到多模态推理

Image

从 ChatGPT 大模型爆火到现在,语言模型已经从关注知识强度(从互联网上抓取的大量数据)转变为优先考虑模型行为。这种行为强调将任务分解为子任务,对它们进行推理,并提供连贯的结果,而不仅仅是预测下一个 token。

Image

语言模型提供商的创新也较少出现在 API 框架上,而更多地关注最终用户 UI 开发,以增强最终用户体验。同样,这些元素包括作浏览器和计算机 GUI 的 LM、上下文管理、合成不同的数据源等。

模型现在可以实时流式传输其推理,为用户提供一个了解其内部逻辑的窗口,这一进步引入了更强的可观察性和可检查性。

期间,语言模型经历了重大转变,从静态知识库演变为动态的多功能 AI 系统。这篇文章将探讨语言模型的进展、它们的功能以及为支持不断扩展的功能而不断发展的框架。

Image

01 数据和内容进展

最初,语言模型被设计为知识密集型的。Meta 引入了“知识密集型 NLP”(KI-NLP) 一词来描述严重依赖大量数据集来获得事实准确性的模型。

然而,人们很快就发现,虽然这些模型可以存储和检索大量信息,但它们在生产环境中并不总是可靠的,尤其是在企业 AI 框架中。

最大的挑战之一是幻觉,其中模型产生了高度合理但事实不正确的回答。为了解决这个问题,AI 研究转向上下文学习,其中模型优先考虑推理过程中提供的上下文参考数据,而不是仅仅依赖其预先训练的知识。

这种方法需要从单个提示扩展到更广泛的框架级实施,使检索增强生成 (RAG) 系统能够有效地集成外部数据源。

到 2024 年,出现了大量用于增强 RAG 框架的产品,使大型语言模型能够动态整合相关数据并更有效地做出响应。

这种转变导致了接地原则的引入,用户可以将文档直接上传到无代码用户界面。然后,这些文档充当实时上下文参考,确保 AI 生成的响应更准确、更相关。

Image

02 推理在 AI 中的作用

a. 语言模型中的代理特征介绍

谷歌研究论文引入的思维链 (CoT) 推理概念已成为 AI 进步的基本原则。CoT 推理可以通过三种主要方式实现:

  1. 提示工程:明确指示语言模型遵循分步推理过程以提高准确性。通过将复杂问题分解为连续的子任务,语言模型输出的准确性大大提高。

  2. 无代码提示链接:这种方法涉及将多个 Prompts连接/链接在一起,其中一个 Prompt 的输出作为下一个 Prompt 的输入。虽然有效,但事实证明很难有效地扩展。这种方法也非常僵化,并遵循预先确定的事件流。

  3. 代理框架:这些框架主要使用 ReAct 方法进行推理,然后采取行动。

模型开始内化推理,并发布了许多推理模型。其中模型执行问题的内部分解,并以自动化方式遵循推理方法。

这个领域的一个有趣的发展是实时推理透明度。

语言模型(如 DeepSeek 和 Grok3)已开始流式传输其内部推理步骤,使用户能够观察如何得出结论。

OpenAI 引入了语言模型推理,但用户需要为底层 Tokens 的使用付费,而无法了解实际的推理过程。

现在,模型正在转向使其内部逻辑对用户更易于访问和透明。

另一个重大进步是集成了外部工具和功能,允许 AI 模型与外部 API、图形用户界面和其他外部系统连接。这使它们的可用性扩展到了简单的对话界面之外,实现了与外部世界的直接交互。

03 采用能动性特征的语言模型

特别有趣的是,AI 模型本身正在演变为自主 AI 代理,采用以前为基于代理的框架保留的功能。

虽然代理框架对于复杂的企业应用程序仍然至关重要,但 AI 模型越来越多地在本地整合类似代理的功能。

这就提出了一个问题:这对构建器工具意味着什么?

虽然 AI 模型可以通过 ChatGPT 等托管环境有效地为个人用户提供服务,但组织仍需要精细控制、定制和高级开发框架来维护企业级 AI 管理。

Image

04 用户体验和一般功能

现在,语言模型已经以不止一种方式变成多模态。AI 驱动的用户界面中的标准功能现在包括:

  • 文档上传:用户可以上传参考资料以提高上下文准确性。

  • 代码生成和执行:LM UI不仅可以生成代码,还可以执行和调试代码。

  • 基于网络的研究:语言模型可以从多个来源搜索网络并综合信息。

  • 增强的用户上下文感知:模型可以根据用户提供的 bios、偏好和过去的交互进行调整。

语言模型本身与用户界面功能之间的界限正在迅速模糊。

语言模型提供商正在将功能直接集成到他们的模型中,而不是依赖外部软件层。

未来,向基于代码的接口和分层 AI 访问模型的转变可能会加速。

随着 AI 公司优先考虑大众市场采用,开发者可能会发现自己被优先考虑更有利于消费者的应用程序。

然而,对以开发者为中心的 AI 工具的需求仍然强劲,这确保了专业的 AI 驱动软件开发将继续蓬勃发展。

Last but not least

语言模型的演变正在转向实时上下文基础、多模式推理和问题解决以及集成工具。虽然消费者语言模型界面变得越来越无缝,但企业仍然需要可定制、可扩展的框架来有效地部署语言模型。

随着模型的不断发展,挑战将是平衡普通消费者的易用性与开发者和企业的强大功能。


关注公众号,用极客视角洞察未来!

Image

往期精彩文章推荐:

1.DeepSeek-R1与Kimi k1.5强化学习架构对比

2.LangGraph Multi-Agent Supervisor工作原理,附实践教程

3.向量搜索和相似性搜索的5个常见错误