Claude Mythos 报告:最让人不安的发现
Anthropic 最近发的 Claude Mythos Preview System Card,243 页,包含非常多功能安全的信息,当然网上也有恐惧营销的质疑。 报告认为,模型越强,越可靠,用户越愿意放权,风险也就越容易被放大。 Anthropic 这次甚至没有公开模型本身,只让少数合作伙伴在防御性网络安全场景里…
阅读全文 :Claude Mythos 报告:最让人不安的发现
架构、后端技术、人生思考等
Anthropic 最近发的 Claude Mythos Preview System Card,243 页,包含非常多功能安全的信息,当然网上也有恐惧营销的质疑。 报告认为,模型越强,越可靠,用户越愿意放权,风险也就越容易被放大。 Anthropic 这次甚至没有公开模型本身,只让少数合作伙伴在防御性网络安全场景里…
阅读全文 :Claude Mythos 报告:最让人不安的发现在 GTC 2026 上,Jeff Dean 和 Bill Dally 两位 Google 和 Nvidia 的首席科学家,对谈信息密度极高。 视频开始是 Bill Dally 关于推理延迟的分析,他指出优化到极致之后瓶颈在通信而非计算,并给出了具体的工程路径: 片上通过静态调度去掉路由开销,实现 30 纳秒穿越芯片…
阅读全文 :Google和Nvidia首席科学家在GTC聊了什么最近中关村论坛有一场 AI 开源圆桌,杨植麟主持,张鹏、夏立雪、罗福莉、黄超从算力、模型、框架、基础设施四个层面聊了 agent 时代的现状和走向。 夏立雪说她一开始用 OpenClaw 觉得慢、不像对话,后来才意识到它不是聊天机器人,是能帮你完成大型任务的人。这个认知转变我自己也经历过。一旦你开始把真正复杂的任务交…
阅读全文 :龙虾时代Token两周翻一番,这场圆桌聊到未来刚看完 Qwen 前负责人林俊旸在 X 上新帖: From "Reasoning" Thinking to "Agentic" Thinking 在离职后首次系统地复盘了 Qwen 的思考 thinking / 指令 instruct 路线。 重要的一句是:we did not get everything righ…
阅读全文 :林俊旸离职后首次复盘 Qwen 路线今天看了杨植麟在 GTC 2026 的演讲,同时也结合去看了演讲提到的 Kimi 团队近期发布的 Attention Residuals 和 Kimi Linear 两篇论文。 大部分读者可能对 LLM 内部优化(包括一些术语)比较陌生,不过通过这类创始人或技术负责人在关键节点的公开分享,我们也可以高效地了解行业发展…
阅读全文 :Kimi连换三个LLM基础组件,全跑通了最近听了 Lex Fridman 对 Demis Hassabis 的一期播客访谈(Lex #475 ),是 Demis 拿诺奖之后的第二次上节目。推荐直接去 Lex 播客看完整版,信息密度极高。 可以分享点很多,Demis 的大部分思考也比我们日常的关注点高几个维度,先说跟程序员相关的。Demis 谈程序员未来时说…
阅读全文 :他想用AGI回答的第一个问题,不是你想的那个最近 Cursor Composer 2 用了 Kimi-k2.5 作为基础模型,刚好也顺便看了张小珺对杨植麟去年 7 月的一篇访谈,还是 K2 发布后不久做的。但是访谈所有内容今天来看都没有过时。 杨植麟在访谈里反复提到 David Deutsch 的《无穷的开始》,用"问题不可避免,问题可以被解决"来框定他对 A…
阅读全文 :Cursor选Kimi,杨植麟去年说透三方产品逻辑最近断续听一期7小时的播客:张小珺对谢赛宁的长访谈。谢赛宁是NYU教授,何恺明长期合作者,DiT的共同提出者,刚和图灵奖得主LeCun一起创立了AMI Labs,25个人拿了10.3亿美金的Seed轮。 这期播客特殊之处不是因为融资数字,而是谢赛宁提出了一个不同于主流的判断:硅谷被LLM催眠了。 他的核心论点是:语言…
阅读全文 :预测next state而非token世界模型在赌什么我个人以及不少“古早”程序员对开发环境都有某种洁癖,例如非常谨慎的选择及安装稳定版本的最小工具集。 这种习惯至少有两个显而易见的好处: 1️⃣ 极致性能:减少常驻内存和存储占用,系统始终轻快。 2️⃣ 安全可控:每个包都在掌控中,规避恶意软件和 Dependency Hell。 但在 AI 时代,这种洁癖正变得奢侈。…
阅读全文 :OpenAI买下uv,A家买下Bun,AI编程赛道白热化中山大学与阿里联合发布的 SWE-CI 报告,给正处于 AI 编程狂热中的我们泼了一盆冷水。这是首个关注持续集成循环(CI loop)的代码维护 Benchmark。 【核心数据揭晓】 Claude Opus 断层领先:但在长周期的代码演进中,最强模型的零回归率也仅过半(50%+)。 “快照式”神话破灭:绝大多数模型…
阅读全文 :100亿token实测18个模型,仅一家能长期维护前两天在 X 看到不少英文用户在热议前 Manus 后端负责人在 Reddit 上面发表的帖子,发现文章里面很多启发,整理成贴图分享给大家。 前 Manus 后端负责人两年 Agent 开发实战总结。 核心观点:与其给 LLM 一堆 function calling 工具,不如只给一个 run(command="..…
阅读全文 :前Manus后端负责人Agent架构复盘附血泪教训Autoresearch:让AI智能体为你通宵全自动调参炼丹! Andrej Karpathy近期推出了颠覆性的开源项目:Autoresearch,它标志着AI研究迈入了“全自动化”的新阶段。 该项目基于极简的大语言模型训练框架 nanochat,允许用户通过编写 program.md 发出宏观指令,由AI智能体(如…
阅读全文 :硬核实操:本机部署AI小模型自我演进实验别再搞混了!Agent Framework 与 Agent Harness 的全景解析指南 随着 AI 技术的演进,构建智能体的工具层出不穷,但“智能体框架(Agent Framework)”和“智能体底座(Agent Harness)”这两个词却常被混淆。 通过贴图深度剖析了两者在“设计主张(Opinionatio…
阅读全文 :一文搞懂Agent harness与framework本质区别🚀 软件行业的终极颠覆:万亿级“数字打工人”时代来袭! 随着 AI 技术的飞速发展,智能体(Agents)已不再是只会聊天的机器人,而是演变为拥有独立沙箱、长期记忆、能 24 小时自主运行的超级员工。本文深度前瞻了这一技术拐点带来的核心变革: 未来所有软件的最大用户将不再是人类,而是数以万亿计的 agent 智能体!…
阅读全文 :1个员工,1000个Agent: 软件未来是面向Agent揭秘 Meta 最新研究:AI Agent 无需执行代码,精准完成代码审查与Bug定位!🤖✨ 摘要: 如何让大语言模型(LLM)在不运行代码的情况下,精准理解复杂的代码语义?Meta 的最新论文《Agentic Code Reasoning》给出了一套惊艳的解决方案:半形式化推理(Semi-formal reason…
阅读全文 :Meta最新研究: Agent无需执行代码完成审查🕵️ 来自OpenAI内部Harness Engineering的经验 全AI开发产品,人类写0行代码?!🚀 揭秘 OpenAI 内部实验:百万行代码,人类 0 行手写!🤖✨ 你敢想象吗?一个拥有百万行代码、包含完整功能与真实日活用户的软件产品,竟然完全没有人类手写过一行代码!这篇文章将带你深入 OpenAI 内部的…
阅读全文 :来自OpenAI内部Harness Engineering的经验最近 Warp (warp.dev) 创始人提出了一个观点: 我们可能很快就不再需要构建 App 了,为什么? 未来的逻辑不再是“开发一个 App”,而是“你帮我把 X 做了”。 当通过 AI 可以直接完美实现用户意图时,中间层确实没有存在意义。 科技领域正在发生的巨大范式转移:从“独立应用”向“元应用”的进化。传统…
阅读全文 :别卷App!元应用时代:意图即结果无需中间层告别 Tab 键:Cursor 正式宣告进入 AI Agent 驱动的编程“第三纪元”。 在 AI agent 迅猛发展的背景下,Cursor AI CEO Michael Truell 于 2026 年 2 月 26 日分享文章,宣告进入“软件开发第三时代”。 如果说第一纪元的 Tab 补全 只是帮我们省去了敲击键…
阅读全文 :挥泪告别Tab键:Cursor 开启 AI 智能体时代也许是软件行业的新一波重构开始了 2026年刚过完农历年,行业就迎来了真正的地震 Jack Dorsey 宣布 Block 裁员 40% ,不是因为业务不行,而是因为 AI 实在太行了 Balaji 称这是 AI 引发的第一波真正裁员,Stripe、Shopify 也在全速跟进。核心逻辑变了:智能工具 + 极简团队正…
阅读全文 :接下来是不是和Mac Mini坐一桌的资格都没了