凡人小北

【译】Anthropic 教育报告:AI 流利度指数

什么是 AI 流利度? 就像"英语流利度"衡量你多会用英语交流,"AI 流利度"衡量你多会和 AI 协作。迭代追问、批判审视、主动设定协作规则,这些行为习惯越好,流利度越高。

本文完整翻译自 Anthropic 官方研究报告(2026年2月23日发布)。核心发现:85.7% 的高质量对话都有迭代改进;但当 AI 产出精美成品时,用户反而更少质疑。

▼ 正文 ▼

人们正以前所未有的速度将 AI 工具融入日常生活。这种速度,一年前都难以想象。但"用起来了"本身说明不了太多问题。更重要的问题是:随着 AI 成为日常的一部分,人们是否在学会更好地使用它?

之前的 Anthropic 教育报告研究了大学生和教育工作者如何使用 Claude。我们发现,学生用它来撰写报告、分析实验数据;教师用它来制作课件、处理日常事务。但我们知道,任何使用 AI 的人都有可能在这方面变得更强。我们想进一步探索,了解人们如何随着时间推移,培养 AI 流利度。

在这份报告中,我们开始回答这个问题。我们分析了大量匿名对话,追踪其中是否出现代表 AI 流利度的行为。

与我们最近发布的经济指数研究一致,我们发现:最常见的 AI 流利表现是增强型的:把 AI 当思考伙伴,而不是把任务全扔给它。事实上,这类对话展现的流利度行为数量,是那种快速一问一答式对话的两倍多。

但我们也发现:当 AI 产出 artifacts(包括应用、代码、文档或交互工具)时,用户质疑其推理的可能性降低了 3.1 个百分点,识别缺失信息的可能性降低了 5.2 个百分点。这与我们最近关于编程技能的研究发现一致。

这些初步发现为我们提供了一个基准,用于研究 AI 流利度如何随时间演变。

📊 衡量 AI 流利度

为了量化 AI 流利度,我们使用了 4D AI 流利度框架,由 Rick Dakan 和 Joseph Feller 教授与 Anthropic 合作开发。该框架定义了 24 种具体行为,代表安全有效的人机协作。

其中 11 种可以在对话中直接观察(见下图)。其余 13 种(比如诚实说明 AI 在工作中的作用、考虑分享 AI 生成内容的后果等)发生在 Claude.ai 的聊天界面之外,因此难以追踪。这些不可观察的行为是 AI 流利度中最关键的维度,我们计划在未来使用定性方法来评估。

在本研究中,我们聚焦于 11 种可直接观察的行为。我们使用隐私保护分析工具,研究了 2026 年 1 月一周内在 Claude.ai 上进行的、包含多轮往返的 9,830 段对话。然后,我们评估了这 11 种行为的有无,每段对话可能展现多种行为。我们通过检查结果在一周内各天以及不同语言样本中的一致性,来评估样本的可靠性(结果确实一致)。最终,我们得到了 AI 流利度指数:一个衡量当前人机协作水平的基准,也为追踪未来变化打下基础。

Image

9,830 段 Claude.ai 对话中各 AI 流利度行为指标的出现频率,按从高到低排列,并按能力类别着色。

🔍 研究结果

通过首次研究,我们在 Claude 使用中发现了两个主要模式:AI 流利度与通过更长对话进行迭代改进之间的强关联,以及用户在编程或构建其他输出时流利度行为的变化。

流利度与展现迭代改进的对话高度相关

数据中最显著的模式之一是"迭代改进"与其他所有 AI 流利度行为之间的关系。我们样本中 85.7% 的对话展现了迭代改进:在之前交流的基础上不断完善用户的工作,而非接受第一个回答就转向新任务。这些对话展现出明显更高的其他流利度行为比例,如下图所示:

Image

有迭代改进的对话 (n=8,424) vs 无迭代改进的对话 (n=1,406) 中各行为指标的出现频率。所有行为在有迭代的对话中都明显更常见。

平均来看,有迭代的对话展现 2.67 个流利度行为,是无迭代对话(1.33 个)的两倍。这在与评估 Claude 输出相关的流利度行为中尤为明显。有迭代改进的对话中,用户质疑 Claude 推理的可能性是无迭代对话的 5.6 倍,识别缺失信息的可能性是 4 倍。

创建输出时,用户更主动但更少审视

我们样本中 12.3% 的对话涉及 artifacts,包括代码、文档、交互工具和其他输出。在这些对话中,人们与 AI 的协作方式截然不同。

具体来说,我们发现属于"描述"和"委派"这两大主题的行为比例明显更高。例如,与非 artifact 对话相比,这些对话更有可能看到用户明确目标(+14.7pp)、指定格式(+14.5pp)、提供示例(+13.4pp)和迭代(+9.7pp)。换句话说,他们在工作开始时做了更多来引导 AI。

但这种主动性并没有带来更高的审视或辨别水平。事实恰恰相反:在创建 artifacts 的对话中,用户更不可能识别缺失信息(-5.2pp)、核实事实(-3.7pp)或通过要求其解释理由来质疑模型的推理(-3.1pp)。我们的经济指数研究发现,越复杂的任务,Claude 越吃力。所以这种审视下降尤其值得注意。

Image

有 artifacts 的对话 (n=1,209) vs 无 artifacts 的对话 (n=8,621) 中各行为指标的出现频率。描述和委派类行为在 artifact 对话中增加,而三种审视类行为都下降。

对于这种模式,有几种可能的解释。可能是 Claude 创建了看起来精美、功能完整的输出,让人觉得似乎没必要再追问:如果工作看起来已经完成了,用户可能就会这样对待它。也可能是 artifact 对话涉及的任务中,事实准确性不如美观或功能性重要(比如设计 UI,而非撰写法律分析)。或者用户是在对话之外评估的:运行代码、测试应用、分享给同事。

无论解释是什么,这种模式值得关注。随着 AI 模型越来越能够产出精美的输出,批判性评估这些输出的能力将变得更加重要。

💡 提升你自己的 AI 流利度

和所有技能一样,AI 流利度也分高低。我们大多数人都还有提升空间。根据数据中的模式,我们发现许多用户可以在三个方面改进技能:

留在对话中。迭代改进是我们数据中与所有其他流利度行为最强相关的单一因素。所以,当你收到初始回答时,把它当作只是一个起点:追问后续问题,对感觉不对的部分提出质疑,不断明确你要找的东西。

质疑精美的输出。当 AI 模型产出看起来不错的东西时,正是暂停思考的好时机:这准确吗?有什么遗漏吗?这个推理站得住脚吗?如上所述,我们的数据显示,精美的输出与较低的批判性评估比例同时出现,尽管用户在一开始花了更多精力来引导 Claude 的工作。

设定协作条款。只有 30% 的对话中,用户告诉 Claude 他们希望它如何与自己互动。试着明确添加指令,比如"如果我的假设有误,请指出来","在给我答案之前,先带我过一遍你的推理",或"告诉我你不确定的地方"。在一开始就建立这些期望,可以改变对话其余部分的动态。

⚠️ 局限性

这项研究有一些重要的注意事项:

• 样本局限:我们的样本反映的是 2026 年 1 月单一周内进行多轮对话的 Claude.ai 用户。由于我们认为 AI 工具的扩散仍处于相对早期,这些用户可能偏向已经熟悉 AI 的早期采用者——即可能无法代表更广泛的人群。所以这个基准适用于这一人群,而非普遍人群。数据来自单一周,无法捕捉季节性或长期效应。而且由于聚焦于 Claude.ai,我们无法捕捉用户与其他 AI 平台的互动。

• 部分框架覆盖:在本研究中,我们只评估了 24 种行为指标中可在 Claude.ai 对话中直接观察到的 11 种。所有与负责任和道德使用 AI 输出相关的行为都发生在这些对话之外,未被捕获。

• 二元分类:对于样本中的每段对话,我们将每种行为分类为"有"或"无"。但这可能遗漏了重要的细微差别——比如有争议的或部分展现的行为,或它们之间的重叠信号。

• 隐性行为:用户可能在心理上展现流利度行为(比如根据自己的知识核实 Claude 的说法),而没有在对话中表达这些行为。这对于我们关于 artifacts 的数据似乎尤其相关——用户可能通过测试和实际使用来评估 Claude 的输出,而非通过对话可见的行为。

• 相关性发现:这些发现是相关性的,无法确定因果。我们不知道一种行为是否导致另一种,还是它们都反映了某些共同因素,比如任务复杂性或用户偏好。

🔮 展望未来

这项研究为我们提供了一个基准,可用于评估 AI 流利度如何随时间变化。随着 AI 能力的发展和采用率的增加,我们希望了解用户是否在发展更复杂的行为,哪些技能会随着经验自然出现,哪些需要更刻意的培养。

在未来的工作中,我们计划从几个方向扩展分析。首先,我们计划进行"队列分析",比较新用户和资深用户,以了解对 AI 的熟悉程度与流利度发展的关联。其次,我们计划使用定性研究方法来评估无法在 Claude.ai 对话中直接观察到的行为。第三,我们希望探索这项工作提出的因果问题——比如鼓励迭代对话是否会带来更高的批判性评估,或者是否有其他干预措施能更有效地鼓励这一点。

此外,我们还想探索 Claude Code 中的 AI 流利度行为——这是一个主要由软件开发者使用的平台。在准备本研究时,我们进行了一些初步分析,发现 Claude Code 对话与 Claude.ai 对话之间存在一致性。但这仍是初步的,Claude Code 的用户和功能都很不同,需要更深入研究。

我们预计 AI 流利度的本质将随时间大幅发展和演变。通过这项和未来的研究,我们希望让这种发展变得可见、可测量、可行动。

———————————

📎 原文链接:anthropic.com/research/AI-fluency-index