歸
公众号

歸藏的AI工具箱

产品设计师AI画图工具操作员AI课程撰写与信息收集整理致力于发掘借助AI工具改善

790 篇已收录文章

这个来源的文章

按发布时间排序

Deepmind 负责 Nano Banana 的模型研究员录了一期播客(youtube.com/watch?v=H6ZXujE1qBA),非常值得看一下,我整理了一下视频内容:\n\n新模型与原生图像生成的核心:\n2.5 的核心变化,在于将图像生成、理解与编辑纳入同一多模态上下文里执行。“原生图像生成”意味着模型在一次对话流中逐步产出多张图,并且每一步都“看得到”之前生成的图像与文本,从而可以在风格、构图和语义上保持连续一致。\n它更像是一条带状态的生成轨道,每一步的输出既是结果,也是下一步的条件。这一“交错式生成”范式,让复杂编辑自然拆分为多步序列,避免了在“单步巨复杂指令”中丢失细节。\n当把“理解”和“生成”并置在同一训练与推理体内会有明显的“正向迁移”:图像理解能力的提升,会帮助生成学习到更多关于真实世界与视觉结构的知识;反之亦然。\n\n文本渲染为何重要:\n传统图像/视频模型优化,很依赖人类偏好作为评测信号,这类信号真实但成本高、滞后长、主观性强,难以高频爬坡。\n团队因此寻找可以在训练过程中高频追踪的替代指标。文本渲染成为突破口:若模型能在图像中准确构造字形、排布与空间关系,说明其对“视觉结构”的掌握在增强。\n这一代理指标的价值在于可持续追踪:无论是架构、数据、训练策略的实验,只要把文本渲染纳入固定监控,就能避免回归,并捕捉到意外有效的改动。\n字是一种高度结构化的微任务。当模型学会了在复杂背景中稳定地“写字”,它也更有机会正确处理“平行线条”“规整网格”等同样结构化的视觉课题,让整体画面更可信。\n\n多模态正向迁移:\n团队把图像理解与生成称作姐妹。统一训练的目标,是在同一模型里学习多模态的理解/生成能力,并在两者之间产生“正向迁移”。\n在生成中辅助理解”的路径:让模型在解题过程中画图打草稿,以更好地把抽象问题视觉化、结构化。一次会话里,模型既能接收用户图片、文本,又能生成中间图像,再用这些中间产物辅助下一步思考,形成自洽的多模态推理链。\n\n展望,从更好看到更聪明与更靠谱:\n对未来方向,团队强调两条主线:其一是聪明感”。他们希望当用户指令“不充分、甚至有误”时,模型能“越级发挥”,做出“比用户描述更好”的结果。\n其二是事实性/严谨性。在图表、流程图、信息图等“既要好看又要准确”的任务里,模型需要严格遵循事实与排版约束,避免多余文本和逻辑错误,让视觉表达与内容正确双达标。

阅读全文 :Deepmind 负责 Nano Banana 的模型研究员录了一期播客(youtube.com/watch?v=H6ZXujE1qBA),非常值得看一下,我整理了一下视频内容:\n\n新模型与原生图像生成的核心:\n2.5 的核心变化,在于将图像生成、理解与编辑纳入同一多模态上下文里执行。“原生图像生成”意味着模型在一次对话流中逐步产出多张图,并且每一步都“看得到”之前生成的图像与文本,从而可以在风格、构图和语义上保持连续一致。\n它更像是一条带状态的生成轨道,每一步的输出既是结果,也是下一步的条件。这一“交错式生成”范式,让复杂编辑自然拆分为多步序列,避免了在“单步巨复杂指令”中丢失细节。\n当把“理解”和“生成”并置在同一训练与推理体内会有明显的“正向迁移”:图像理解能力的提升,会帮助生成学习到更多关于真实世界与视觉结构的知识;反之亦然。\n\n文本渲染为何重要:\n传统图像/视频模型优化,很依赖人类偏好作为评测信号,这类信号真实但成本高、滞后长、主观性强,难以高频爬坡。\n团队因此寻找可以在训练过程中高频追踪的替代指标。文本渲染成为突破口:若模型能在图像中准确构造字形、排布与空间关系,说明其对“视觉结构”的掌握在增强。\n这一代理指标的价值在于可持续追踪:无论是架构、数据、训练策略的实验,只要把文本渲染纳入固定监控,就能避免回归,并捕捉到意外有效的改动。\n字是一种高度结构化的微任务。当模型学会了在复杂背景中稳定地“写字”,它也更有机会正确处理“平行线条”“规整网格”等同样结构化的视觉课题,让整体画面更可信。\n\n多模态正向迁移:\n团队把图像理解与生成称作姐妹。统一训练的目标,是在同一模型里学习多模态的理解/生成能力,并在两者之间产生“正向迁移”。\n在生成中辅助理解”的路径:让模型在解题过程中画图打草稿,以更好地把抽象问题视觉化、结构化。一次会话里,模型既能接收用户图片、文本,又能生成中间图像,再用这些中间产物辅助下一步思考,形成自洽的多模态推理链。\n\n展望,从更好看到更聪明与更靠谱:\n对未来方向,团队强调两条主线:其一是聪明感”。他们希望当用户指令“不充分、甚至有误”时,模型能“越级发挥”,做出“比用户描述更好”的结果。\n其二是事实性/严谨性。在图表、流程图、信息图等“既要好看又要准确”的任务里,模型需要严格遵循事实与排版约束,避免多余文本和逻辑错误,让视觉表达与内容正确双达标。

前段时间闭门会有家长问怎么教孩子用 AI,刚好 Anthropic 发布了三门面向教育工作者和学生的 AI 课程。\n\n为教师设计的 “AI Fluency for Educators” 指导如何在教学材料、评估和课堂讨论中融入 AI。\n\n面向学生的 “AI Fluency for Students” 强调在课程与职业规划中负责任地协作 AI,学生在与 AI 共事的同时培养自己的批判性思维技能。\n\n“Teaching AI Fluency” 则帮助教师在校园推广 AI 素养,提供教学与评估框架及课程设计建议。\n\n家长感觉只需要关注前两门课程就行。\n\n\nAI Fluency for Students (anthropic.skilljar.com/ai-fluency-for-students)的详细课程内容:\nAI流利度框架介绍:通过2节课,系统讲解4D框架在学生学习和成长中的应用,帮助学生理解如何在不同情境下与AI协作。\n4D框架在学习与职业规划中的应用:通过2节课,结合实际案例,指导学生如何将4D框架应用到学业任务、知识理解、职业技能发展和未来规划中,强调“人始终在环”——即在与AI协作时保持主动性、判断力和责任感。\n\nAI Fluency for Educators(anthropic.skilljar.com/ai-fluency-for-educators)的详细课程内容:\n介绍AI流畅性框架,帮助学员理解如何在学生场景中应用委托、描述、辨别和勤勉四个维度。\n展示如何将4D框架应用于课程设计和学习材料的开发,利用AI作为思维伙伴,提升教学内容的连贯性和评估的真实性。\n通过实际案例和经验,指导学员在教学实践中负责任地与AI协作,并为学生树立良好榜样。

阅读全文 :前段时间闭门会有家长问怎么教孩子用 AI,刚好 Anthropic 发布了三门面向教育工作者和学生的 AI 课程。\n\n为教师设计的 “AI Fluency for Educators” 指导如何在教学材料、评估和课堂讨论中融入 AI。\n\n面向学生的 “AI Fluency for Students” 强调在课程与职业规划中负责任地协作 AI,学生在与 AI 共事的同时培养自己的批判性思维技能。\n\n“Teaching AI Fluency” 则帮助教师在校园推广 AI 素养,提供教学与评估框架及课程设计建议。\n\n家长感觉只需要关注前两门课程就行。\n\n\nAI Fluency for Students (anthropic.skilljar.com/ai-fluency-for-students)的详细课程内容:\nAI流利度框架介绍:通过2节课,系统讲解4D框架在学生学习和成长中的应用,帮助学生理解如何在不同情境下与AI协作。\n4D框架在学习与职业规划中的应用:通过2节课,结合实际案例,指导学生如何将4D框架应用到学业任务、知识理解、职业技能发展和未来规划中,强调“人始终在环”——即在与AI协作时保持主动性、判断力和责任感。\n\nAI Fluency for Educators(anthropic.skilljar.com/ai-fluency-for-educators)的详细课程内容:\n介绍AI流畅性框架,帮助学员理解如何在学生场景中应用委托、描述、辨别和勤勉四个维度。\n展示如何将4D框架应用于课程设计和学习材料的开发,利用AI作为思维伙伴,提升教学内容的连贯性和评估的真实性。\n通过实际案例和经验,指导学员在教学实践中负责任地与AI协作,并为学生树立良好榜样。

AI 游戏爆发的前夜?\n\n写周刊的时候搜罗了一下上周的主要新闻发现三巨头没啥信息增量,反倒是 AI 游戏或者说“AI 驱动的可互动内容消费”这个领域出现了很多令人欣喜的变化。\n\n\n首先是 Runway 跨界搞得 AI 游戏平台 Game Worlds 正式上线了,用户可以创建或者游玩别人创建的非线性叙事游戏,游戏主要通过不断的选择分支或者对话进行。\n\n本质上是在过去原有的 AI 陪伴流程基础上进行的创新,主要创新点:\n\n内容上用实时生成的图文内容表现游戏内容,UI 排版很像漫画,为了搞定文字生成的问题,文字是用 UI 展示在图像上的。\n创建游戏世界的时候会让你详细设定游戏的规则,比如胜利条件、失败条件、背景故事、图像风格等。\n游戏会采用数据驱动的方式让游玩者清晰的感知到自己的目标,而不是像之前的 AI 陪伴那样漫无目的聊天发散,非常依赖用户的主动性。\n\n\n然后是香港科技大学开发的开放式数字沙盒游戏 Aivilization ,用户可以在游戏中通过提示词驱动自己的 Agent 角色完成各种采集交易学习建造等任务,可以看作一个 AI 星露谷。\n\n但是跟星露谷不同的是,这个游戏是联机的,所有用户的 Agent 都在交易和采集会对市场产生影响,相互的角色也会有交互。\n\n参与者可在可视化界面中为 Agent 设定人格、能力、价值观与目标,并通过编辑认知与行为模块、提供提示及长期指导,持续观察其在虚拟社会中的协作、交易、记忆与信任构建过程。\n\n如果上面 Runway 的这种游戏形式代表着降低游戏生成内容复杂性的尝试的话。Aivilization 就是提供了一个高度复杂、可扩展的智能体社会仿真框架,为构建大型、动态、自主演进的游戏世界奠定了基础,超越了传统游戏中 NPC 的能力。\n\n\n另外一个是李飞飞的 World lab 终于开测了,很多人都收到了邀请,你可以用一张图片生成一个永久可探索的 3D 空间,这个和谷歌的 Genie 3 是两个世界模型的路径。\n\nWorld Labs 的方法融合了计算机视觉重建与生成式填充技术。本质上,它从输入照片推断出场景的三维结构和纹理分布,然后利用生成模型补全照片未涵盖的视角区域,产出360度完整场景。\n\n主要特点有:单次生成、持续稳定、即时交互、可轻度编辑。 目前来看 World Labs 稳定,但是 Genie 3 交互性和创意性比较强。

阅读全文 :AI 游戏爆发的前夜?\n\n写周刊的时候搜罗了一下上周的主要新闻发现三巨头没啥信息增量,反倒是 AI 游戏或者说“AI 驱动的可互动内容消费”这个领域出现了很多令人欣喜的变化。\n\n\n首先是 Runway 跨界搞得 AI 游戏平台 Game Worlds 正式上线了,用户可以创建或者游玩别人创建的非线性叙事游戏,游戏主要通过不断的选择分支或者对话进行。\n\n本质上是在过去原有的 AI 陪伴流程基础上进行的创新,主要创新点:\n\n内容上用实时生成的图文内容表现游戏内容,UI 排版很像漫画,为了搞定文字生成的问题,文字是用 UI 展示在图像上的。\n创建游戏世界的时候会让你详细设定游戏的规则,比如胜利条件、失败条件、背景故事、图像风格等。\n游戏会采用数据驱动的方式让游玩者清晰的感知到自己的目标,而不是像之前的 AI 陪伴那样漫无目的聊天发散,非常依赖用户的主动性。\n\n\n然后是香港科技大学开发的开放式数字沙盒游戏 Aivilization ,用户可以在游戏中通过提示词驱动自己的 Agent 角色完成各种采集交易学习建造等任务,可以看作一个 AI 星露谷。\n\n但是跟星露谷不同的是,这个游戏是联机的,所有用户的 Agent 都在交易和采集会对市场产生影响,相互的角色也会有交互。\n\n参与者可在可视化界面中为 Agent 设定人格、能力、价值观与目标,并通过编辑认知与行为模块、提供提示及长期指导,持续观察其在虚拟社会中的协作、交易、记忆与信任构建过程。\n\n如果上面 Runway 的这种游戏形式代表着降低游戏生成内容复杂性的尝试的话。Aivilization 就是提供了一个高度复杂、可扩展的智能体社会仿真框架,为构建大型、动态、自主演进的游戏世界奠定了基础,超越了传统游戏中 NPC 的能力。\n\n\n另外一个是李飞飞的 World lab 终于开测了,很多人都收到了邀请,你可以用一张图片生成一个永久可探索的 3D 空间,这个和谷歌的 Genie 3 是两个世界模型的路径。\n\nWorld Labs 的方法融合了计算机视觉重建与生成式填充技术。本质上,它从输入照片推断出场景的三维结构和纹理分布,然后利用生成模型补全照片未涵盖的视角区域,产出360度完整场景。\n\n主要特点有:单次生成、持续稳定、即时交互、可轻度编辑。 目前来看 World Labs 稳定,但是 Genie 3 交互性和创意性比较强。

千问刚发布的图像编辑模型与FLUX比怎么样

今天评测千问的新模型,Qwen Image Edit。 我们拿它和 FLUX Kontext 对比。 先说结果: 开源图像编辑独一份的中文生成和编辑能力 图像是全图重绘,相较于 FLUX 容易丢失细节 中文文字修改提示词遵循不是很好 图像美学表现相对 FLUX 较差,AI 感重 总的来说,中文编辑是它的亮点。 但美学…

阅读全文 :千问刚发布的图像编辑模型与FLUX比怎么样

谷歌的最强图像编辑模型即将发布

我们可能要获得一个比 FLUX Kontext 更牛批的图像编辑模型了 lmarena 出现了一个叫 nano-banana 的图像编辑模型,非常牛批,效果很好,试了一下在角色和场景还原度以及融合效果上完爆 FLUX Kontext 上面是我跑的一些案例,破案了朋友们,谷歌的,他怎么全都牛皮啊,还有人管管吗

阅读全文 :谷歌的最强图像编辑模型即将发布

谷歌最近的模型进展太快了,而且全面开花。 他们的开发者负责人访谈了 Deepmind CEO,里面详细介绍了: Genie 3 世界模型的信息、通往 AGI 的路径、产品迭代方法等,干货挺多的,我总结了一下。\n\n他把迈向 AGI 的路径拆分为模型、评测、工具三个相互强化的支点:\n\n模型:在基础网络中引入显式「思考」与「世界模型」,通过多模态互补、规划搜索和自监督,对感知与推理进行一体化表征。\n评测:从静态数据集转向动态、自适应、对抗性环境,让基准能随能力提升而自动升级难度,并覆盖物理直觉与安全性维度。\n工具:把外部算力与专用子模型视为「延伸器官」,允许主模型在推理过程中即时调用,并通过代理调度形成系统级闭环。\n\n这三者缺一不可:没有强模型,再复杂的评测只是「秀场」;没有合适的测评,模型无法有针对性地优化;缺少工具链则会让模型陷入「闭门造车」。这一三角形心智模型为 DeepMind 制定路线图提供了结构化的思考框架。\n\n\nGenie 3 引出一种「内化现实」的方法论:\n\n不再单纯追求图像或文字的表层相似度,而是要求模型在潜在空间建立对物理规律、材料属性、时间连续性的因果图谱。训练流程可按以下逻辑拆解:\n从高保真模拟环境中收集具备物理一致性的多模态数据(视觉、深度、动作);\n\n通过自监督损失逼迫网络同时最小化预测下一帧像素和保持对象持久性;\n在推理阶段反向使用该世界模型生成新场景,验证其自洽性;\n利用外部 Agent 在生成世界中完成任务,进一步采样「硬例」细化模型。\n\n这一框架的核心心智在于:只有当 AI 能「想象」世界并用行动检验想象,才算真正理解世界。\n\n\n产品设计需要前瞻性:\n\n与指数级底座赛跑,底层模型更新速度已逼近「双周级」,传统瀑布式需求规划难以跟上。Demis 提供了如下心智模型:\n\n以「能力预测表」替代「需求列表」:先列出未来 12 个月大模型大概率将具备的 API 与思考能力,再反推用户体验。\n设计「可撤换引擎」:核心逻辑应与模型调用松耦合,后端一旦升级仅需调整提示词或调用格式。\n构建「不可平替」价值层」:把精力投入模型短期内难以原生支持的环节,如高精度数据管道、合规策略或领域知识图谱。\n\n团队避免在过快迭代的基础设施上投入过深,同时让产品能够「踩准节拍」地吃到每一波模型红利。\n\n视频:youtube.com/watch?v=njDochQ2zHs

阅读全文 :谷歌最近的模型进展太快了,而且全面开花。 他们的开发者负责人访谈了 Deepmind CEO,里面详细介绍了: Genie 3 世界模型的信息、通往 AGI 的路径、产品迭代方法等,干货挺多的,我总结了一下。\n\n他把迈向 AGI 的路径拆分为模型、评测、工具三个相互强化的支点:\n\n模型:在基础网络中引入显式「思考」与「世界模型」,通过多模态互补、规划搜索和自监督,对感知与推理进行一体化表征。\n评测:从静态数据集转向动态、自适应、对抗性环境,让基准能随能力提升而自动升级难度,并覆盖物理直觉与安全性维度。\n工具:把外部算力与专用子模型视为「延伸器官」,允许主模型在推理过程中即时调用,并通过代理调度形成系统级闭环。\n\n这三者缺一不可:没有强模型,再复杂的评测只是「秀场」;没有合适的测评,模型无法有针对性地优化;缺少工具链则会让模型陷入「闭门造车」。这一三角形心智模型为 DeepMind 制定路线图提供了结构化的思考框架。\n\n\nGenie 3 引出一种「内化现实」的方法论:\n\n不再单纯追求图像或文字的表层相似度,而是要求模型在潜在空间建立对物理规律、材料属性、时间连续性的因果图谱。训练流程可按以下逻辑拆解:\n从高保真模拟环境中收集具备物理一致性的多模态数据(视觉、深度、动作);\n\n通过自监督损失逼迫网络同时最小化预测下一帧像素和保持对象持久性;\n在推理阶段反向使用该世界模型生成新场景,验证其自洽性;\n利用外部 Agent 在生成世界中完成任务,进一步采样「硬例」细化模型。\n\n这一框架的核心心智在于:只有当 AI 能「想象」世界并用行动检验想象,才算真正理解世界。\n\n\n产品设计需要前瞻性:\n\n与指数级底座赛跑,底层模型更新速度已逼近「双周级」,传统瀑布式需求规划难以跟上。Demis 提供了如下心智模型:\n\n以「能力预测表」替代「需求列表」:先列出未来 12 个月大模型大概率将具备的 API 与思考能力,再反推用户体验。\n设计「可撤换引擎」:核心逻辑应与模型调用松耦合,后端一旦升级仅需调整提示词或调用格式。\n构建「不可平替」价值层」:把精力投入模型短期内难以原生支持的环节,如高精度数据管道、合规策略或领域知识图谱。\n\n团队避免在过快迭代的基础设施上投入过深,同时让产品能够「踩准节拍」地吃到每一波模型红利。\n\n视频:youtube.com/watch?v=njDochQ2zHs

Open AI 也发布了 GPT-5 的官方提示词指南,更适合开发者参考。\n\n基本涉及了 AI 产品和 Agent 构建的各个方面,我总结了一下还是推荐看原文:\n\n\n智能体任务与工具调用\n\nAgentic Workflow Predictability:推荐使用 Responses API 持续保存推理过程,提升智能体应用效率。\n\nAgentic Eagerness:可通过调整 `reasoning_effort` 参数和提示词,控制模型的主动性。\n降低主动性:使用低 `reasoning_effort`,明确探索范围和早停标准,减少不必要的工具调用和上下文收集。\n提高主动性:提升 `reasoning_effort`,鼓励模型持续完成任务,减少向用户确认或交还的频率。\nTool Preambles:通过提示词引导模型在工具调用前,简明扼要地重述用户目标、规划执行步骤。\n\n\n推理与上下文复用\n\nReasoning Effort:可根据任务复杂度调整推理深度。复杂任务建议高推理力度,并将任务拆分为多个步骤分批完成。\nResponses API:推荐使用 Responses API 传递前序推理结果,节省 token。\n\n\n代码生成与协作\n\n前端开发推荐栈:GPT-5 在前端开发表现优异,推荐使用 Next.js、React、Tailwind CSS、shadcn/ui 等主流框架和组件库。\n零到一应用生成:通过提示模型自建评估标准,并据此反复自我优化,提升一次性生成应用的质量。\n代码风格与规范:明确代码编辑规则、工程原则、目录结构和 UI/UX 最佳实践,确保模型生成代码与现有项目风格一致。\n协作编码案例:通过参数和提示词双重控制,平衡输出简洁性与代码可读性,鼓励模型主动提出变更并让用户审核。\n\n可控性与指令遵循\n\nSteerability:GPT-5 对提示词的可控性极高,可控制输出长度、风格和工具调用行为。\nVerbosity:新增 `verbosity` 参数,控制最终答案的长度。可在提示词中覆盖默认设置,实现场景化定制。\nInstruction Following:GPT-5 对提示词指令极为敏感,需避免矛盾或模糊的指令。\n\n官方原文:cookbook.openai.com/examples/gpt-5/gpt-5_prompting_guide

阅读全文 :Open AI 也发布了 GPT-5 的官方提示词指南,更适合开发者参考。\n\n基本涉及了 AI 产品和 Agent 构建的各个方面,我总结了一下还是推荐看原文:\n\n\n智能体任务与工具调用\n\nAgentic Workflow Predictability:推荐使用 Responses API 持续保存推理过程,提升智能体应用效率。\n\nAgentic Eagerness:可通过调整 `reasoning_effort` 参数和提示词,控制模型的主动性。\n降低主动性:使用低 `reasoning_effort`,明确探索范围和早停标准,减少不必要的工具调用和上下文收集。\n提高主动性:提升 `reasoning_effort`,鼓励模型持续完成任务,减少向用户确认或交还的频率。\nTool Preambles:通过提示词引导模型在工具调用前,简明扼要地重述用户目标、规划执行步骤。\n\n\n推理与上下文复用\n\nReasoning Effort:可根据任务复杂度调整推理深度。复杂任务建议高推理力度,并将任务拆分为多个步骤分批完成。\nResponses API:推荐使用 Responses API 传递前序推理结果,节省 token。\n\n\n代码生成与协作\n\n前端开发推荐栈:GPT-5 在前端开发表现优异,推荐使用 Next.js、React、Tailwind CSS、shadcn/ui 等主流框架和组件库。\n零到一应用生成:通过提示模型自建评估标准,并据此反复自我优化,提升一次性生成应用的质量。\n代码风格与规范:明确代码编辑规则、工程原则、目录结构和 UI/UX 最佳实践,确保模型生成代码与现有项目风格一致。\n协作编码案例:通过参数和提示词双重控制,平衡输出简洁性与代码可读性,鼓励模型主动提出变更并让用户审核。\n\n可控性与指令遵循\n\nSteerability:GPT-5 对提示词的可控性极高,可控制输出长度、风格和工具调用行为。\nVerbosity:新增 `verbosity` 参数,控制最终答案的长度。可在提示词中覆盖默认设置,实现场景化定制。\nInstruction Following:GPT-5 对提示词指令极为敏感,需避免矛盾或模糊的指令。\n\n官方原文:cookbook.openai.com/examples/gpt-5/gpt-5_prompting_guide