MacTalk·2025年12月21日 终于,NotebookLM 和 Gemini 合体了。这是什么神之更新? 阅读全文 ↗:终于,NotebookLM 和 Gemini 合体了。这是什么神之更新? M
MacTalk·2025年12月20日 最新:AI 大神 Andrej Karpathy 的 2025 LLM 回顾\n\n早上醒来就看了 Andrej Karpathy 的最新英文 blog:2025 大模型年度回顾。\n\n文中有很多链接,我翻译后放到墨问里了:Andrej Karpathy:2025 大模型年度回顾,全文一共 4000 字左右。非常精彩。\n\n2025 年,LLM 进展迅猛纷繁复杂,这份清单,包括了今年所有值得注意、甚至有点出人意料的“范式变化”——那些改变了版图结构、在概念上让人眼前一亮的事物。\n\n首先,RLVR(来自可验证奖励的强化学习)成为训练主舞台。实验室把更多算力投到可以自动验证的环境(比如数学、编程等等),模型通过更长的推理轨迹与“思考时间”获得实质能力增益,预训练被压缩,推理成了每家基座模型厂商重点产品特征。\n\n其次,Andrej 把 LLM 的智能形态比作“鬼魂”而非“动物”。由于优化压力与数据来源不同,模型在可验证领域出现尖刺般的“锯齿式智能”,既像通才天才又像困惑小学生。\n\n这也让很多基准测试失去了真正的价值,在测试集上训练成为新艺术:谁都能打爆基准,但距离 AGI 似乎越来越远了。\n\n应用层方面,Cursor 的走红代表了垂直领域编程在 LLM 上的新突破:上下文工程、复杂领域交互(GUI)、编程推理等等。他判断基础模型更像“通用大学生”,而应用会把他们组织成“在岗专业人士”,接入私域数据与执行流程里。\n\n在 Agent 方面,Claude Code 给出了样板:在本地把工具使用与推理循环起来处理长任务,强调与个人环境、低延迟、机密与上下文的结合。他认为这比云端容器化代理更符合当前“能力锯齿、渐进”的现实。\n\n事实上在国内 Agent 产品(Lovart、灵光、秒哒、MiniMax Agent 等)今年在 Agent 方面发展的也都非常快。\n\nVibe Coding 确实越来越强了,一切可 Vibe:用自然语言直接写出实用软件,让非专业者也能编程,也促使专业者用一次性、可塑的代码快速验证与造物,改变软件的生产方式与岗位描述。\n\n这一点和我昨天介绍秒哒的概念非常一致。\n\n谷歌的图片模型不得不提,作为 LLM 的 GUI 信号:把文本、图像生成与世界知识统一起来,推动 LLM 从命令行式对话走向人类偏好的视觉、空间化表达(图片、信息图、白板、Web 应用)。\n\n这与个人计算机、互联网等历史脉络是一致的。\n\n总结一下:今年的 LLM 更聪明也更笨,但极其有用;行业实现的潜力不到 10%。进展会持续加速,同时还有大量基础工作需要完成。系好安全带。 阅读全文 ↗:最新:AI 大神 Andrej Karpathy 的 2025 LLM 回顾\n\n早上醒来就看了 Andrej Karpathy 的最新英文 blog:2025 大模型年度回顾。\n\n文中有很多链接,我翻译后放到墨问里了:Andrej Karpathy:2025 大模型年度回顾,全文一共 4000 字左右。非常精彩。\n\n2025 年,LLM 进展迅猛纷繁复杂,这份清单,包括了今年所有值得注意、甚至有点出人意料的“范式变化”——那些改变了版图结构、在概念上让人眼前一亮的事物。\n\n首先,RLVR(来自可验证奖励的强化学习)成为训练主舞台。实验室把更多算力投到可以自动验证的环境(比如数学、编程等等),模型通过更长的推理轨迹与“思考时间”获得实质能力增益,预训练被压缩,推理成了每家基座模型厂商重点产品特征。\n\n其次,Andrej 把 LLM 的智能形态比作“鬼魂”而非“动物”。由于优化压力与数据来源不同,模型在可验证领域出现尖刺般的“锯齿式智能”,既像通才天才又像困惑小学生。\n\n这也让很多基准测试失去了真正的价值,在测试集上训练成为新艺术:谁都能打爆基准,但距离 AGI 似乎越来越远了。\n\n应用层方面,Cursor 的走红代表了垂直领域编程在 LLM 上的新突破:上下文工程、复杂领域交互(GUI)、编程推理等等。他判断基础模型更像“通用大学生”,而应用会把他们组织成“在岗专业人士”,接入私域数据与执行流程里。\n\n在 Agent 方面,Claude Code 给出了样板:在本地把工具使用与推理循环起来处理长任务,强调与个人环境、低延迟、机密与上下文的结合。他认为这比云端容器化代理更符合当前“能力锯齿、渐进”的现实。\n\n事实上在国内 Agent 产品(Lovart、灵光、秒哒、MiniMax Agent 等)今年在 Agent 方面发展的也都非常快。\n\nVibe Coding 确实越来越强了,一切可 Vibe:用自然语言直接写出实用软件,让非专业者也能编程,也促使专业者用一次性、可塑的代码快速验证与造物,改变软件的生产方式与岗位描述。\n\n这一点和我昨天介绍秒哒的概念非常一致。\n\n谷歌的图片模型不得不提,作为 LLM 的 GUI 信号:把文本、图像生成与世界知识统一起来,推动 LLM 从命令行式对话走向人类偏好的视觉、空间化表达(图片、信息图、白板、Web 应用)。\n\n这与个人计算机、互联网等历史脉络是一致的。\n\n总结一下:今年的 LLM 更聪明也更笨,但极其有用;行业实现的潜力不到 10%。进展会持续加速,同时还有大量基础工作需要完成。系好安全带。
MacTalk·2025年12月20日 The content has been deleted by the author. undefined 阅读全文 ↗:The content has been deleted by the author.
MacTalk·2025年12月17日 18 天做出来的产品,一个月留存 1%。OpenAI 抄袭 Skills? 阅读全文 ↗:18 天做出来的产品,一个月留存 1%。OpenAI 抄袭 Skills? M
MacTalk·2025年12月16日 AI 在研发和工程上,到底能帮我们做多少?\n\n今天中午我们把做了好几个月的墨问时间知识库发了,具体可以看这里:\n嗷嚎,我们又做了个新产品\n\n这个产品是今年的计划之一,一方面我不希望星球上的三年创作就那么沉下去了,我自己还得看呢。另一方面是把 AI 知识库这件事弄清楚,未来这个应该是墨问的基础能力之一,创作类型的产品,没有 AI 知识库不太像话。\n\n产品发布之后,很多用户私信问我,这玩意怎么做的?企业做知识库很需要啊,还有你们怎么梳理数据,分类做标签?怎么实现问答召回,干这些脏活累活,AI 能帮咱们干多少?如何让 AI 打败(构建) AI 产品呢?\n\n这是个系统工程,我可以简单说说我们的做法。\n\n完成这个产品构建的基础是 260 万高质量成体系的文字,大约 1300 篇笔记。内容维度分为横向和纵向,横向是大的分类,比如对谈、书评、实践案例和创业手记等,这个手工做就搞定了,纵向我定位为标签,我们提取了 100 多个公共 tag,这个事儿借助了 AI 技术。\n\n先把每篇笔记喂给 AI,让大模型提取 3~10 个相关度最高的关键词。这时候产生的关键词比较发散,除了个别关键词,大部分关键词都只关联少部分笔记,聚合度是不够的。\n\n然后写脚本统计词频,从全部关键词里找出词频最高的 n 个关键词。这个步骤会从词频最高的 n 个关键词里,剔除一些特别“泛”的关键词(你我他然后所以等),这时候需要人工介入,最终形成一个关键词库。然后让 AI 通过这个关键词库,给每一篇笔记打标签,这样,基于标签 <——> 笔记的多对多的网状关系就建好了,聚合度也好很多。\n\n接下来需要对笔记的格式和内容进行清洗,短文本、长文章和问答形式的帖子,都得整理成符合墨问笔记的格式,有些内容还需要舍弃,这个需要工程师编写程序完成。\n\n把这些都搞完,一个干净漂亮的知识库数据集就搞出来了。\n\n然后开始做知识库底层技术的选型,这时候字节的火山团队正在推广他们的向量库和记忆库,本来大家也认识,那就合作一把,这样问答和召回、包括深度思考这部分也就搞定了。\n\n向量库是个很好的技术,可以做高效的、跨模态的语义检索。具体原理简单说就是,很多数据切片被分配到高维数学空间中,相似的物体(如“iPhone”和“智能手机”)在空间中距离很近,就可以被检索到,并返回给用户。\n\n有了这些你还需要设计 UI,完成交付给用户的工程产品,就是墨问时间知识库。那么,AI 帮我们做了多少呢?这么看,还真不少呢。 阅读全文 ↗:AI 在研发和工程上,到底能帮我们做多少?\n\n今天中午我们把做了好几个月的墨问时间知识库发了,具体可以看这里:\n嗷嚎,我们又做了个新产品\n\n这个产品是今年的计划之一,一方面我不希望星球上的三年创作就那么沉下去了,我自己还得看呢。另一方面是把 AI 知识库这件事弄清楚,未来这个应该是墨问的基础能力之一,创作类型的产品,没有 AI 知识库不太像话。\n\n产品发布之后,很多用户私信问我,这玩意怎么做的?企业做知识库很需要啊,还有你们怎么梳理数据,分类做标签?怎么实现问答召回,干这些脏活累活,AI 能帮咱们干多少?如何让 AI 打败(构建) AI 产品呢?\n\n这是个系统工程,我可以简单说说我们的做法。\n\n完成这个产品构建的基础是 260 万高质量成体系的文字,大约 1300 篇笔记。内容维度分为横向和纵向,横向是大的分类,比如对谈、书评、实践案例和创业手记等,这个手工做就搞定了,纵向我定位为标签,我们提取了 100 多个公共 tag,这个事儿借助了 AI 技术。\n\n先把每篇笔记喂给 AI,让大模型提取 3~10 个相关度最高的关键词。这时候产生的关键词比较发散,除了个别关键词,大部分关键词都只关联少部分笔记,聚合度是不够的。\n\n然后写脚本统计词频,从全部关键词里找出词频最高的 n 个关键词。这个步骤会从词频最高的 n 个关键词里,剔除一些特别“泛”的关键词(你我他然后所以等),这时候需要人工介入,最终形成一个关键词库。然后让 AI 通过这个关键词库,给每一篇笔记打标签,这样,基于标签 <——> 笔记的多对多的网状关系就建好了,聚合度也好很多。\n\n接下来需要对笔记的格式和内容进行清洗,短文本、长文章和问答形式的帖子,都得整理成符合墨问笔记的格式,有些内容还需要舍弃,这个需要工程师编写程序完成。\n\n把这些都搞完,一个干净漂亮的知识库数据集就搞出来了。\n\n然后开始做知识库底层技术的选型,这时候字节的火山团队正在推广他们的向量库和记忆库,本来大家也认识,那就合作一把,这样问答和召回、包括深度思考这部分也就搞定了。\n\n向量库是个很好的技术,可以做高效的、跨模态的语义检索。具体原理简单说就是,很多数据切片被分配到高维数学空间中,相似的物体(如“iPhone”和“智能手机”)在空间中距离很近,就可以被检索到,并返回给用户。\n\n有了这些你还需要设计 UI,完成交付给用户的工程产品,就是墨问时间知识库。那么,AI 帮我们做了多少呢?这么看,还真不少呢。
MacTalk·2025年12月14日 周末看了个 OpenAI 论坛的内部分享,叫 Vibe Engineering。\n\n内容不少,我整理了分享的全文放到墨问里,差不多 9000 字,还有实操项目的 github 仓库地址,可以先收藏再看:OpenAI 内部分享:Vibe 工程\n\n什么是 Vibe Engineering?AI 不只是“帮你写代码”,而是参与到工程的全链路里,帮你更快做出能上线、能维护、能扩展的生产级软件。前提是:每一行要发到生产环境的代码,仍然必须由人来负责。他们把这种用法叫做 “Vibe Engineering”。\n\n它和过去一年流行的 “Vibe Coding” 最大的不同是,从“写出一段能跑的代码”升级为“完成一次真正的工程交付”。\n\n很多 AI 编程工具最近都在做这方面的变化。\n\n为了讲清楚这件事,OpenAI 的工程师 Aaron Friel 做了一个硬核 demo:用 Rust 重写一个成熟的 Kotlin 开源项目,并且做到了和原项目 100% 兼容。\n\n任务从一个空目录开始,除了提示词什么都没有。使用传统做法,这种重写加验证可能要几周时间;而在他的实验里,Codex 能够连续工作十几个小时,把脚手架、测试体系、对照验证、文档都推进到一个可以跑通 CI 的程度。\n\n这里的关键不在于“模型写了多少行”,而是它如何“像工程师一样工作”。\n\nFriel 给 Codex 的不是一串小任务,而是一套长期目标和约束,并要求它维护一个持续更新的计划文档(exec plan)。更有意思的是,Codex 会自动拉起子 Agent:一个像“Watch Dog”一样不断提醒不要偏离整体目标;另外一些子 Agent 去并行做研究,补齐背景知识,甚至会主动 clone 仓库、对照实现等等。\n\n分享里讲了 Vibe Engineering 的三个方法论:\n\n1、让 AI 写可读的产物,而不只是可运行的代码。\n\n2、并行化。Codex 提供的 “Best of N” 思路很像把一个问题同时交给四个候选工程师:让它们走不同路线,产出不同方案,然后人来选更符合目标、也更符合品味的那个。\n\n3、把“技术能力”外溢到工程团队之外。在 OpenAI,Codex 也被用来帮助产品、销售、现场支持等非工程角色理解代码库:当他们想知道一个功能怎么工作,先问 Codex。\n\n这套东西应该对 AI 改进研发团队的效率有很大启发,推荐一下。 阅读全文 ↗:周末看了个 OpenAI 论坛的内部分享,叫 Vibe Engineering。\n\n内容不少,我整理了分享的全文放到墨问里,差不多 9000 字,还有实操项目的 github 仓库地址,可以先收藏再看:OpenAI 内部分享:Vibe 工程\n\n什么是 Vibe Engineering?AI 不只是“帮你写代码”,而是参与到工程的全链路里,帮你更快做出能上线、能维护、能扩展的生产级软件。前提是:每一行要发到生产环境的代码,仍然必须由人来负责。他们把这种用法叫做 “Vibe Engineering”。\n\n它和过去一年流行的 “Vibe Coding” 最大的不同是,从“写出一段能跑的代码”升级为“完成一次真正的工程交付”。\n\n很多 AI 编程工具最近都在做这方面的变化。\n\n为了讲清楚这件事,OpenAI 的工程师 Aaron Friel 做了一个硬核 demo:用 Rust 重写一个成熟的 Kotlin 开源项目,并且做到了和原项目 100% 兼容。\n\n任务从一个空目录开始,除了提示词什么都没有。使用传统做法,这种重写加验证可能要几周时间;而在他的实验里,Codex 能够连续工作十几个小时,把脚手架、测试体系、对照验证、文档都推进到一个可以跑通 CI 的程度。\n\n这里的关键不在于“模型写了多少行”,而是它如何“像工程师一样工作”。\n\nFriel 给 Codex 的不是一串小任务,而是一套长期目标和约束,并要求它维护一个持续更新的计划文档(exec plan)。更有意思的是,Codex 会自动拉起子 Agent:一个像“Watch Dog”一样不断提醒不要偏离整体目标;另外一些子 Agent 去并行做研究,补齐背景知识,甚至会主动 clone 仓库、对照实现等等。\n\n分享里讲了 Vibe Engineering 的三个方法论:\n\n1、让 AI 写可读的产物,而不只是可运行的代码。\n\n2、并行化。Codex 提供的 “Best of N” 思路很像把一个问题同时交给四个候选工程师:让它们走不同路线,产出不同方案,然后人来选更符合目标、也更符合品味的那个。\n\n3、把“技术能力”外溢到工程团队之外。在 OpenAI,Codex 也被用来帮助产品、销售、现场支持等非工程角色理解代码库:当他们想知道一个功能怎么工作,先问 Codex。\n\n这套东西应该对 AI 改进研发团队的效率有很大启发,推荐一下。
MacTalk·2025年12月12日 如果不是看奥特曼的社交媒体,我还真不知道 OpenAI 这家公司已经成立 10 年。\n\n2023 年这家公司因为 ChatGPT 的爆火突然出现在公众视野,我也是那时候才知道 OpenAI,其时七年已过。公开信我整理在墨问里了,2000 字,可读可听:奥特曼公开信:OpenAI 的十年\n\n十年对一家技术公司来说,可长可短。足够长,是因为它可以验证一个事业的真伪。足够短,是因为三年前大模型才被世界发现,AI 时代才刚刚开始。\n\n这份信读起来克制、平静,甚至带着一点工程师式的迟疑。奥特曼反复强调的是不确定性、误解、大量的失败,以及在混沌中持续向前行走、笨拙却坚定的力量。\n\n信里面打动我的不是 GPT 4 的高光时刻,而是他们团队在几乎没有确定答案的时候,仍然选择长期主义。十五个人坐在一起,讨论“这件事是否重要到值得失败很多次”。这种判断十年前几乎是反直觉的。\n\n十年已过,ChatGPT 成了世界上活跃度最高的 AI 服务和产品,人们开始思考:人如何与自己创造的工具相处。\n\n奥特曼怎么说呢?“我相信日常生活和我们最在意的事物改变不会太大,我相信我们仍会更关注别人做了什么,而不是机器做了什么。另一个意义上,2035 年的人们将能做到一些我认为我们现在难以想象的事情”。\n\n这么看来,2035 也并不遥远。 阅读全文 ↗:如果不是看奥特曼的社交媒体,我还真不知道 OpenAI 这家公司已经成立 10 年。\n\n2023 年这家公司因为 ChatGPT 的爆火突然出现在公众视野,我也是那时候才知道 OpenAI,其时七年已过。公开信我整理在墨问里了,2000 字,可读可听:奥特曼公开信:OpenAI 的十年\n\n十年对一家技术公司来说,可长可短。足够长,是因为它可以验证一个事业的真伪。足够短,是因为三年前大模型才被世界发现,AI 时代才刚刚开始。\n\n这份信读起来克制、平静,甚至带着一点工程师式的迟疑。奥特曼反复强调的是不确定性、误解、大量的失败,以及在混沌中持续向前行走、笨拙却坚定的力量。\n\n信里面打动我的不是 GPT 4 的高光时刻,而是他们团队在几乎没有确定答案的时候,仍然选择长期主义。十五个人坐在一起,讨论“这件事是否重要到值得失败很多次”。这种判断十年前几乎是反直觉的。\n\n十年已过,ChatGPT 成了世界上活跃度最高的 AI 服务和产品,人们开始思考:人如何与自己创造的工具相处。\n\n奥特曼怎么说呢?“我相信日常生活和我们最在意的事物改变不会太大,我相信我们仍会更关注别人做了什么,而不是机器做了什么。另一个意义上,2035 年的人们将能做到一些我认为我们现在难以想象的事情”。\n\n这么看来,2035 也并不遥远。
MacTalk·2025年12月09日 《Google 9 小时提示工程课程》逐分钟实战总结\n\n上周墨问上热帖之一是这篇提示词的实战总结。业余咖啡师申屠制作,用 20 分钟的篇幅,把框架、方法论、示例、技巧做成了一个结构清晰的墨问合集,一共八篇,能读完你就是人生赢家。\n\n《Google 9 小时提示工程课程》逐分钟实战总结(20 分钟浓缩版)\n还有一篇也不错:Nano Banana Pro 完整指南:专业资产制作的10个技巧\n\n对个人来说,在 AI 时代,真正的门槛不是模型,而是人如何与模型对话。\n\n这几年写作、做产品、拍照,甚至跑步,我越来越意识到一个事实:各种工具越来越强,人很容易被强工具“推着走”。AI 大模型更像是把一座核电站放桌上,随时能点亮世界,可如果输入不清楚,输出也会跟着迷糊。\n\n于是,我们开始追问——怎样让机器更像“合作者”,而不是那个让人不断猜谜的家伙?\n\nGoogle 提出的这个 TCREI 框架是一个简单而有效的回答。Task、Context、Reference、Evaluate、Iterate——任务、上下文、参考样例、评估、迭代,五个步骤像是整理房间的流程,先归类东西,再决定场景,给例子,对照标准,最后不断迭代打磨。\n\n说白了,提示工程是在帮助人类恢复久违的清晰思考:你要什么,你在什么场景下要它,你期望它怎么呈现,它离目标差在哪儿,下一步还需要调整什么。\n\n迭代部分最有意思。Ramen Saves Tragic Idiots 这个好记的口号背后,是人机协作里最朴素的逻辑,AI 不会自动变好,你得带它一起变好:\n\nRevisit:重新检视\nSeparate:把长 Prompt 拆成多个短 Prompt\nTry:换种表达方式或换一个类比任务\nIntroduce Constraints:加入限制(字数、风格、结构)\n\n就像带新人同事写方案,讲清楚背景,把长句子切短,换几种说法试试,增加边界条件,它就更容易给出稳定的成果。\n\n课程后半部分谈的数据分析、PPT 生成、思维链、思维树,再到 AI Agent 的结构设计,都说明了一个简单的事实:AI 不再只是工具,而是一个具备连续性、具备专业角色感的伙伴。\n\n我看完了,实操性很强。\n\n如果你想高效掌握使用 AI 的方法,这篇笔记足够作为入口了。 阅读全文 ↗:《Google 9 小时提示工程课程》逐分钟实战总结\n\n上周墨问上热帖之一是这篇提示词的实战总结。业余咖啡师申屠制作,用 20 分钟的篇幅,把框架、方法论、示例、技巧做成了一个结构清晰的墨问合集,一共八篇,能读完你就是人生赢家。\n\n《Google 9 小时提示工程课程》逐分钟实战总结(20 分钟浓缩版)\n还有一篇也不错:Nano Banana Pro 完整指南:专业资产制作的10个技巧\n\n对个人来说,在 AI 时代,真正的门槛不是模型,而是人如何与模型对话。\n\n这几年写作、做产品、拍照,甚至跑步,我越来越意识到一个事实:各种工具越来越强,人很容易被强工具“推着走”。AI 大模型更像是把一座核电站放桌上,随时能点亮世界,可如果输入不清楚,输出也会跟着迷糊。\n\n于是,我们开始追问——怎样让机器更像“合作者”,而不是那个让人不断猜谜的家伙?\n\nGoogle 提出的这个 TCREI 框架是一个简单而有效的回答。Task、Context、Reference、Evaluate、Iterate——任务、上下文、参考样例、评估、迭代,五个步骤像是整理房间的流程,先归类东西,再决定场景,给例子,对照标准,最后不断迭代打磨。\n\n说白了,提示工程是在帮助人类恢复久违的清晰思考:你要什么,你在什么场景下要它,你期望它怎么呈现,它离目标差在哪儿,下一步还需要调整什么。\n\n迭代部分最有意思。Ramen Saves Tragic Idiots 这个好记的口号背后,是人机协作里最朴素的逻辑,AI 不会自动变好,你得带它一起变好:\n\nRevisit:重新检视\nSeparate:把长 Prompt 拆成多个短 Prompt\nTry:换种表达方式或换一个类比任务\nIntroduce Constraints:加入限制(字数、风格、结构)\n\n就像带新人同事写方案,讲清楚背景,把长句子切短,换几种说法试试,增加边界条件,它就更容易给出稳定的成果。\n\n课程后半部分谈的数据分析、PPT 生成、思维链、思维树,再到 AI Agent 的结构设计,都说明了一个简单的事实:AI 不再只是工具,而是一个具备连续性、具备专业角色感的伙伴。\n\n我看完了,实操性很强。\n\n如果你想高效掌握使用 AI 的方法,这篇笔记足够作为入口了。