浮之静

Claude Sonnet 4.5、DeepSeek-V3.2 发布,OpenAI 最新动态

假期来临,大模型扎堆发布,咋这么卷呢?OpenAI 似乎正在另辟蹊径,搞产品(如 ChatGPT Pulse、AI 电商、家长控制、或将发布 Sora 2)。

Image

AI 虽卷,但核心逻辑是不变的,我感觉之前写的文章含金量还在提升(截图来自以下两篇):关于 AI 编程的一些浅思、浅谈:实测 Codex 代码重构能力

Image

Claude Sonnet 4.5

吐槽归吐槽(Anthropic 一条公告激起民愤...),Anthropic 的 AI 还是很顶的...

Anthropic 推出全新的 Claude Sonnet 4.5[1]。这是目前在代码编写、复杂任务处理和计算机操作方面表现最为出色的一款模型,在推理能力和数学方面也有明显进步。

我们日常使用的各种软件、表格和工具背后,都是代码在运行。能够高效地使用这些工具、理解问题并找出解决方案,是当下很多工作场景的核心需求。Claude Sonnet 4.5 就是为此而生的。

模型特性

此次发布不仅带来了模型能力的提升,还同步升级了多个产品功能:

  • Claude Code 现在支持 checkpoints,可以随时保存当前状态,并一键回退到之前的进度。
  • 命令行界面进行了全新设计,同时还上线了 VS Code 插件(Claude Code for VS Code[2])。
  • Claude API 新增上下文编辑功能(Context Editing)和记忆工具(Memory Tool),使模型可以处理更复杂、更持久的任务(Managing context on the Claude Developer Platform[3])。
  • 在 Claude 应用中,用户现在可以直接在对话中运行代码、创建表格、文档或幻灯片等文件。
  • Chrome 浏览器插件也已面向 Max 用户开放,支持自动网页浏览、填写表格、处理任务等。
📌 上下文编辑 & 记忆工具

这两项能力专为 Claude Sonnet 4.5 打造,旨在帮助开发者更高效地管理长任务场景下的上下文内容,避免因上下文过载导致性能下降或重要信息丢失。

现实任务不设上限,但上下文有「天花板」

随着智能体在实际场景中处理的任务越来越复杂、调用的工具越来越多,开发者常会遇到一个瓶颈:上下文窗口(Context Window)被迅速填满,导致智能体无法继续运行,或者不得不牺牲部分历史内容来腾出空间。

此次更新提供了两个解决方案,帮助开发者将有效信息保留在上下文中,并让有价值的知识在多轮会话中持续保留。

上下文编辑

清理冗余内容,保持任务连贯

当对话接近上下文上限时,上下文编辑功能会自动清除已过时的工具调用结果和中间内容,只保留真正相关的信息。这意味着,智能体可以连续运行更久,无需手动清理旧内容,执行效率也更高。

这项功能不仅延长了任务执行的“有效时间”,还让模型能集中注意力处理最有用的内容,提高整体表现。

Image

记忆工具

用文件持久存储对话之外的重要信息

记忆工具则通过一个独立的文件系统,为智能体提供了“长记忆”能力。Claude 可在开发者配置的存储目录中读写文件,包括创建、读取、更新、删除等操作。

这项机制让智能体可以逐步积累知识,跨会话记住项目状态、保留已学内容,而无需把所有信息都塞进上下文里。

所有的记忆操作都由开发者本地控制,不依赖云端服务。数据存储在哪里、如何保存,都由开发者自己决定。

智能管理上下文

Claude Sonnet 4.5 内置了上下文追踪能力,可以实时监测剩余 token 数量,并根据情况触发上下文清理或调用记忆模块,使整体运行更智能、更灵活。

二者结合后,不仅能延长对话、减少上下文超载,还能在多轮对话中跨阶段调用关键内容,大大增强了智能体的稳定性与表现力。

应用场景

这些功能特别适合需要长时间运行或频繁上下文交互的场景:

  • 代码开发:清理旧的文件读取、测试结果,保留架构决策、调试记录,便于在大规模代码库中持续工作。
  • 研究分析:删除过时的搜索结果,把重要发现存入记忆库,逐步构建完整的知识体系。
  • 数据处理:处理大批量数据时,将中间结果存储在记忆中,同时清理原始数据,避免 token 数超限。

性能实测

在 Anthropic 内部评估中,结合使用上下文编辑与记忆工具的智能体,在复杂多步骤任务中的表现提升了 39%,单独使用上下文编辑也提升了 29%。

在一项 100 轮网页搜索的测试中,原本容易因上下文超限中断的任务,借助上下文编辑顺利完成,同时 token 使用量减少了 84%。

想了解更多,可查看 Cookbooks 代码示例[4]

Claude Agent SDK 开放使用

Claude Code SDK 已更名为 Claude Agent SDK ,其文档也已重新整理。此变更体现了该 SDK 构建 AI 代理的更广泛功能,而不仅仅是编码任务。

发布了用于构建智能体的 Claude Agent SDK。这套工具原本是为内部产品服务的,现在也向开发者全面开放(闭源钉子户总算有点诚意了)。

过去半年里,不断迭代的 Claude Code 解决了很多技术难题,比如长任务如何保存上下文、权限系统如何平衡自动化和用户控制、多个子模块之间如何协同工作等。Agent SDK 提供了这些基础能力,适用于远不止编程领域的应用。

如果你也想打造类似 Claude Code 的工具,现在已经具备了同样的起点。SDK 分为 Python/TypeScript 版本。

TS 版

代码仓库:https://github.com/anthropics/claude-agent-sdk-typescript

额,说好的开放,咋只提供了安装包,没有代码呢?是不是我来早了,还没上传代码...

Image

安装 SDK:

npm install @anthropic-ai/claude-agent-sdk

Python 版

代码仓库:https://github.com/anthropics/claude-agent-sdk-python

Python 目前是有代码的,感兴趣的可以去探索一下。

Image

安装 SDK:

pip install claude-agent-sdk

表现全面提升

Claude Sonnet 4.5 在多个权威测试中表现优异:

  • 在 SWE-bench Verified 测试中表现领先,该测试以真实软件开发任务为标准。
  • 在 OSWorld 测试中,模型在模拟真实操作系统环境下的任务完成率达到 61.4%,而四个月前的 Claude 4 还停留在 42.2%。
  • 多项常见评测也显示出在推理、数学等方面的明显提升。
Image
Image

此外,金融、法律、医学和理工科领域的专业人士认为,Sonnet 4.5 在专业知识和分析判断方面明显优于前代模型(如 Opus 4.1)。

Image

更稳健,更可靠

除了能力增强,Claude Sonnet 4.5 在安全性和使用稳定性方面也有明显优化。

通过更系统的训练,这一版本在避免阿谀奉承、误导性回答、过度寻求控制权,以及鼓励非理性思维等方面有明显改进。在防范“提示注入”类攻击方面,也做了大量工作,显著提升了模型在自动操作类任务中的安全性。

Image

此次发布还配套上线了 Claude Sonnet 4.5 的系统说明文档,首次引入了解释性测试方法,用于评估模型行为的合理性和一致性。

该模型已纳入 ASL-3(AI 安全等级 3) 保护机制,自动筛查潜在风险内容(特别是与化学、生物、放射性及核相关的话题)。若因筛查误判导致中断,也可随时切换回风险更低的 Sonnet 4 继续使用。

想象力实验:“Imagine with Claude”

为了展示 Claude Sonnet 4.5 的动态生成能力,Anthropic 同步推出了一个短期实验项目 “Imagine with Claude”。在这个实验中,Claude 会根据用户的每一步操作即兴创作软件,不依赖预设功能或已有代码。

这个实验面向 Max 用户开放 5 天,访问地址为:https://claude.ai/imagine

使用 & 价格

Claude Sonnet 4.5 现已全面上线。通过 Claude 的 App、API、Claude Code 或浏览器插件均可直接使用,无需额外设置。API 接入方式为 claude-sonnet-4-5,价格保持不变,与上一版本一致,为 $3/$15 每百万 token。

Claude Code 和开发者平台的功能更新对所有用户开放。代码执行和文件创建功能则面向所有付费用户提供。

目前,在 VS Code 中的 GitHub Copilot 插件也可以使用 Claude Sonnet 4.5 了,需要在 GitHub 设置中开启一下。

Image

小结

如你正在寻找更稳定、能力更强、功能更丰富的模型,Claude Sonnet 4.5 值得一试。它不仅适用于开发者,也适用于任何希望在现代工作流程中提升效率和处理复杂问题的人。

DeepSeek-V3.2-Exp

DeepSeek 团队发布了最新实验性模型 DeepSeek-V3.2-Exp,它是在上一版 V3.1-Terminus 基础上的升级尝试,引入了全新的 DeepSeek Sparse Attention(DSA)机制,目标是提升长上下文场景下的训练与推理效率,同时保持输出质量不变。

V3.2-Exp 搭载 DSA 技术,支持更细粒度的稀疏注意力机制,显著降低计算资源消耗,却几乎不影响模型生成质量。这一机制让模型在处理长上下文输入时更高效、更轻量。从最新的基准测试来看,V3.2-Exp 的整体表现与 V3.1-Terminus 相当,但在资源效率方面取得明显进展。

Image
Image

为让更多用户受益,DeepSeek 已将 API 使用费用下调超过 50%,并已立即生效。访问方式不变,App、Web 和 API 端均可使用。

Image

相关资源:

  • V3.1-Terminus 对比测试:https://api-docs.deepseek.com/guides/comparison_testing
  • 模型下载:https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp
  • 技术报告:https://github.com/deepseek-ai/DeepSeek-V3.2-Exp/blob/main/DeepSeek_V3_2.pdf

DeepSeek-V3.2-Exp 是一次以“效率提升 + 推理一致性”为核心方向的探索性更新,对于关注长上下文生成与成本优化的用户而言,是一项值得关注的实验成果。

OpenAI 新动态

OpenAI 正在深度结合大模型做一些有趣的产品探索。如 ChatGPT Pulse、AI 电商、家长控制、或将发布的 Sora 2。

Image

ChatGPT Pulse

Image

OpenAI 推出全新的 ChatGPT Pulse 功能,目前在移动端面向 Pro 用户开放预览。不同于以往你需要主动提问的方式,Pulse 会根据你的使用习惯、对话记录以及你提供的反馈,每天自动整理出一组与你高度相关的信息更新,帮助你节省时间、聚焦重点,更高效地处理日常事务。

Pulse 的工作原理很简单:每晚,它会根据你近期的聊天内容、你标记过有用或没用的主题,以及(可选)连接的 Gmail 和 Google 日历,自动进行信息整理,并在第二天以“主题卡片”的形式呈现。你可以快速浏览,也可以点开进一步了解详情。更新内容可能包括你常聊话题的后续进展、当天晚餐灵感、旅行建议,甚至是对某个长期目标的下一步建议。如果你连接了日历,它还能提前提醒你会议安排、重要日子,甚至推荐餐厅。

Pulse 并不是为了让你一直刷内容。每次推送的更新都是有限的,只为当天准备。你可以选择保存到对话历史中,或进一步提出问题深入探讨。目标很明确——它不占用你的注意力,只在你需要的时候出现,帮你把事情往前推进。

更重要的是,Pulse 是可以“调教”的。你可以主动告诉它你关心什么,例如让它每周五整理本地活动,或者提醒它明天优先关注某个话题。你也可以通过简单的 👍👎 操作快速反馈内容是否有帮助,并随时查看或清除个性化记录。你的反馈越多,它就越了解你,推荐也会变得更贴切。

在早期的用户测试中,OpenAI 与一些大学生合作,收集了大量使用反馈。一个最关键的发现是:Pulse 的价值往往在你主动告诉它你想看什么之后才真正体现出来。基于这一点,OpenAI 增加了更多引导和反馈机制,让你更容易上手并塑造属于自己的每日信息流。

总的来说,Pulse 是 OpenAI 在 ChatGPT 基础上的一次重要延伸,它试图从“等你提问”迈向“主动服务”。未来几个月内,这一功能也将逐步开放给更多用户。对于每天需要处理大量信息的人来说,Pulse 也许正是一个值得一试的助手。

AI 电商

OpenAI 表示,每天都有数百万人在 ChatGPT 中寻找购物建议。现在从聊天到下单,一步到位。

Image

通过 Instant Checkout 功能,用户可以在对话中直接完成下单购买。该功能基于 Agentic Commerce Protocol (ACP)[5] —— 由 OpenAI 与 Stripe 联合开发的开放标准 —— 为商家和开发者提供了一个简单高效的方式,将对话流量转化为实际销售。

Agentic Commerce Protocol 是一个面向未来的开放标准,旨在让 AI 智能体与企业之间的交易过程变得更加顺畅。它不仅能与现有系统兼容,还具备良好的可扩展性,适应未来智能商业的发展趋势。ACP 接入门槛低,适用于各种支付平台和技术栈,同时也为下一代 AI 驱动的电商体验做好了准备。

ACP 已率先应用于如 Etsy 这样的商家体系中,Shopify 也即将接入。它为 AI 接口处理购物场景提供了基础框架。使用 Stripe 的商家,只需添加一行代码即可开启支付功能;而使用其他支付系统的商家,也可通过 Stripe 的 Shared Payment Token API[6] 或 ACP 的 Delegated Payments 规范实现对接,无需更改原有支付架构。

以下流程图是代理商务协议的端到端数据流。感兴趣的朋友可以查看文档,了解更多 Agentic Commerce[7]。

Image

家长控制

这不就是手机或各种软件的儿童模式或防沉迷功能嘛,果然控制的火已经烧到了 AI。

Image

OpenAI 推出 ChatGPT 家长控制功能,让家长与青少年账号绑定后,自动启用更严格的安全设置,并可根据需要灵活调整功能使用和时间限制。此功能现已在网页端上线,移动端即将推出。设置链接:https://chatgpt.com/parentalcontrols

绑定后,家长可以管理六大关键功能:是否允许显示敏感内容(默认为关闭)、是否启用记忆功能、是否允许对话用于模型训练、设定「安静时间」限制使用时间、关闭语音模式,以及关闭图像生成与编辑功能。

家长无法查看青少年的聊天记录,除非系统检测到严重安全风险,才可能触发通知,并仅提供必要的安全信息。

家长控制的开启需要家长与青少年双方同意绑定,任何一方发起邀请后,另一方确认即可。若青少年中途解除绑定,家长也会收到通知。

OpenAI 表示,家长控制功能是与专家、政策制定者及倡导团体协作设计的,未来将不断优化。同时上线的还有专属资源页面,帮助家长了解 ChatGPT 在家庭中的使用方式与管理建议。

Sora 2 或将发布?

OpenAI 在 X 上发了 3 条视频,结合 Sam 之前的帖子,引起广泛讨论,大意为:OpenAI 正在开发一个独立的社交媒体平台,该平台仅限 AI 生成的视频,时长不超过 10 秒,由即将推出的 Sora 2 模型提供支持,功能包括垂直动态、混音工具、点赞、评论、分享以及个性化视频的身份验证。该应用上周进行了内部测试,获得了员工的积极反馈,公司将其定位为与 Meta 的 Vibes 动态和谷歌在 YouTube Shorts 中集成的 Veo 3 进行竞争。

Image

References

[1]

Claude Sonnet 4.5:https://www.anthropic.com/news/claude-sonnet-4-5

[2]

Claude Code for VS Code:https://marketplace.visualstudio.com/items?itemName=anthropic.claude-code

[3]

Managing context on the Claude Developer Platform:https://www.anthropic.com/news/context-management

[4]

Cookbooks 代码示例:https://github.com/anthropics/claude-cookbooks/blob/main/tool_use/memory_cookbook.ipynb

[5]

Agentic Commerce Protocol (ACP):https://github.com/agentic-commerce-protocol/agentic-commerce-protocol

[6]

Shared Payment Token API:https://docs.stripe.com/agentic-commerce/concepts/shared-payment-tokens

[7]

Agentic Commerce:https://developers.openai.com/commerce