nano banana pro 知识可视化 workflow:6000 字干货笔记
先插播一条通知:
本周五暂停ai主题直播一次。
因为周三周四要在深圳参加小鹅通九周年大会,
周六小树要参加海淀区信息学竞赛的决赛(面向全区五六年级今 7 万小学生,决赛入围 300 人,小树的分数应该在 150 左右)(开心😆),
周五正在从深圳往北京赶。
下面说正事:上周ai讲座的大纲笔记来啦。还没上课的可以大概了解讲了什么,上过课的可以温故知新。
howie 的 ai 主题直播
主题:ai 知识可视化 workflow 与核心理念 主讲:howie.serious 时间:2025-12-12 (W2550) 核心思想:
2025 年是 ai 价值落地的元年。
我们不应止步于“知道”,而要通过 Agency(能动性)去“做到”。
利用“更贵的 Token”和优化的 workflow,将 ai 变为人类的“第四层大脑皮层”,实现从信息输入到知识资产的高效转化。
2025 一句话总纲——“向 ai 要价值”
2025 的典型景象:顶级模型轮流发布、轮流 SOTA、轮流第一、轮流“炸裂” 核心判断:2025 是 ai 价值真正落地的元年 关键原因:2024 年底开始出现真正的 Reasoning Model(推理模型),能力爆发 小能熊的指导思想:向 ai 要价值 → 由此引出 “做中学 ai”;“边做边学,边学边做”;在解决问题、创造价值的过程中学 ai、用 ai;学员收获显著(以“价值落地”为衡量)。
ai 是如何“炼成”的
用“一个顶级大语言模型的养成流程”反推对人类学习/成长的启示。
Pre-train(预训练)→ “通才”
得到:语言能力、世界知识(World Knowledge)、理解能力 类比到人:通识教育 + 语言基础 强调:复杂抽象推理(数学/编程等)之前,应先学好语言、先大量阅读
RL(强化学习)→ “专家”
后训练关键:Reinforcement Learning 类比到人:刻意练习、做题、科学解题步骤、元技能 结论:专家能力必须以“世界知识 + 语言能力”为底座
Tool Use(工具使用)→ “现代人”
2025 的强大量力很大来自 Tool Use:灵活利用顶级人类工具 “裸体智能”很强,但文明是技术驱动,工具会放大人的限制 举例工具:Python / Word / Canvas / 命令行等 小能熊关键词:“善用利器”
Reward Modeling(奖励建模)→ “三观”
类比家庭教育:父母以奖励/惩罚反馈塑造孩子 人的三观来自长期反复的奖惩塑形(追奖避罚) 例子:对金钱的偏好来自成长中反复获得“能吃肉、能买喜欢的东西”的强化 育儿提醒:不只盯成绩,更要看父母日常反馈如何塑造孩子
Alignment(对齐)→ “信念/Value”
对齐的重要性:不对齐会把人变成系统可牺牲的资源(“牛马/素材”) 负面对齐例子:成瘾算法、以金钱指标压过公共安全的系统 对人启发:人的对齐=相信 Value(公平、正义、平等) 家庭教育方式:润物细无声,不是只讲道理
Agency(能动性)→ “做到”
2025 ai 的本质特点:能动性/主动性。给目标 → 主动理解 → 做计划、分解任务、调动资源、投入注意力 → 达成 小能熊的核心词:“做到”。“知道很多道理却过不好这一生” → 因为“知道”不等于“做到”;“念念不忘,必有回响” 回扣:为什么要“做中学 ai”:ai 是用数学与现代科技效法人脑运作方式,思想是“富矿”
知识可视化是 nano banana 的杀手级应用
总判断:only nano banana Can Do
nano banana pro发布两三周,已形成稳定工作流 覆盖形态:ai PPT、知识漫画、信息图等 对比式结论:过去“能做 PPT”的工具(Gamma、manus 等)在 nano banana pro 面前多为 Hype
产出指标(强调“价值密度”)
单张图成本:约 一毛钱 时间:约 一分钟 质量维度:模块设计、数据细节、文字渲染、整体视觉“经得起推敲” 场景价值:放进孩子暑假作业的项目 PPT,“非常体面” 上限判断:作为工具,“我看不到上限”;你能“要”到多少价值取决于人
展示的可视化类型(“你很难想象/很难画出来”的那类)
管理模型的美漫风格图
植物养护手册式信息图
咖啡消费模型的数据图、仪表盘风格可视化
爆炸图、分层结构图(Pizza 第一层/第二层/第三层/第四层)
复杂结构图:如科幻式海底分层结构等
商业/营销材料:文字 → workflow → 图
原来文字说明很多人不看 现在:文字丢给 gemini 做方案 → nano banana pro 出图 图中文字渲染基本没问题;偶尔有问题可“明确指出再生成”
进阶预告:Figma 会员 + ai 局部修改
能圈元素、按图层改细节(更复杂,会在 nano banana workflow 里展示)
知识可视化workflow:从策划到生成
v0:Google 官方示例(起点)
Prompt 特征:直接让你“创作关于地球圈层的科学信息图” 同时写入大量美术语言(配色、手绘/蓝图、单色、强调色、蚀刻蓝图风格等) 关键痛点:这些美术概念让普通人写起来“很费脑子”——不适合人脑去干
v1 拆解与迭代:把 Problem 拆成模块
内容:画什么?(地球圈层)+ 要求中文文字 类型:Genre(科学信息图/科学插图/图表)而非漫画 风格:单色、细节丰富、手绘或蓝图效果 现实问题:只靠 Prompt 的 v1 可能经不起细看(乱码、信息杂乱等)
v2:流程化——Content Strategy vs. Execution
核心转折:把“想清楚画什么”与“把它画出来”拆成两个独立模块。
模块一:内容策划(Planner)
像产品经理做线稿/示意图
决定:画什么、分几个模块、每模块文案、布局位置、视觉风格(配色、整体视觉)
要求:策划“全面”
模块二:美术执行(Artist)
基于策划方案画图(把策划变成视觉成品)
协同工作流:Copy/精修两种模式
用法:把 ai 策划内容 Copy 过来 + 一句“请基于我的策划方案画信息图” 两种协作模式 偷懒模式:直接复制粘贴 精进模式:把策划当“下属作业”,基于你的 Idea 与品味修改 → 更贴近你想要的效果 模型分工建议(按角色选模型) 策划:gemini 3.0 Pro / chatgpt o1 (Thinking) / GPT-5.2 Pro / Claude Opus 4.5 等 画图:nano banana pro (nano banana pro);未来若有 GPT Image 2 也可替换 观察:不同模型的策划会显著影响成图 chatgpt 容易策划太多 → 画面“很满” gemini 的策划风格不同 → 成图也不同
极致偷懒:一句话创作与“扔链接”
目标:一句话让它做一切(如“地球圈层信息图”“养鱼指南”) 更极端:直接扔一个链接(如 Openai 最新 GPT-5.2 Blog) “信息图大师”先出完整方案 → 再扔给 nano banana pro 出图 社群案例:扔 Google 官方 nano banana pro 博客 → 总结 1、2、3、4 特点 + 科技风呈现 用于课堂/大会/汇报 PPT “非常体面” 价值复述:一毛钱 + 一分钟 → 高质量、可控细节、难以人工达到的视觉与内容
知识可视化进阶
多模型协作 + Prompt 版本迭代(把技能变成“元技能”)
流程优化:内容策划环节引入“比稿机制”
“LLM 三人行”:同时让多个模型出策划方案,chatgpt 的 GPTs 做“信息图大师”,Claude 的 Project 做一个,gemini 做一个,甚至 Deep Research / GPT-5 Pro 参与; 决策:择优或融合,形成更好的策划;
Prompt 沉淀:从 3.1 → 3.2 → 4.0 → 5.0…
当 workflow 清晰,技能会越来越顺滑 优质 Prompt 的价值会越来越大(“以前无法想象”) 例子:“三级笔记” Prompt 迭代到 5.1,“500字费曼” Prompt 也迭代多个版本; Prompt 背后的资产含量:半年迭代经验 + 几百例测试 + 多年阅读实践
向ai要价值:不只金钱
时间、情感与思想
高带宽阅读:信息输入带宽 ×10
例子:因为“三级笔记” Prompt,今年终于有时间每天读两回《红楼梦》; 对比:过去听冗长 Podcast 需 1-2 小时,现在可能只需十分之一时间,但效果更优; 结论:改造阅读/写作/工作流程 → 获得大量属于自己的时间;
能够“吃细糠”:把时间还给经典与家人
有了时间就能读“以前没时间读的经典”“无用之书”; 用精品内容滋养精神; 同时:更能关心孩子学习/健康/快乐、陪家人;
审美与品味:ai 时代的稀缺能力
常见问题:社交媒体上大量 ai 内容重复、没品味; 为什么需要“预训练”审美; 家里很多精品画册(如《2021年国际插画展作品集》),看得多才会有 Idea(类比 ai 的 Pre-train); “只有吃过细糠,才能产出细糠”:要当 PPT/可视化/漫画大师 → 得画很多图(刻意练习);每次正反馈/负反馈沉淀到 Prompt 里; 形式与内容的匹配:什么值得做?用什么方式做? 知识漫画适合抽象、复杂、陌生的难题(如 Transformer 内部结构);但把“大道理”做成漫画,会“很讨厌、面目可憎、没有价值” 正面参照:日本欧姆社(Ohmsha)几十年做“漫画讲微积分/统计/傅里叶/生化…”;《可怕的科学》(Horrible Science)用漫画讲科学史地等,风靡几十年(家里孩子翻烂);
Token 经济学
为什么你要用更贵的 ai
优质产出需要优质 Token(以及更多 Token)
为什么策划用 gemini / Deep Research / GPT-5,而不是直接让 nano banana pro 画?
因为要消耗更优质、更贵的 Token,获得更高质量逻辑与策划 对“便宜模型”的定位:更像陪伴/角色扮演等,不追求高质量逻辑(原话带有强烈立场)
“算力即价值”:价格上涨是好迹象
提到:GPT-5.2 API 单 Token 价格大幅提升(被视为“好迹象”) 一分价钱一分货:Token 太便宜 → 为压成本 → 质量自然不好 长期信念:未来 80 亿人很多原本靠人脑做的事,会花在 GPU 上 因而英伟达、Google 等在 GDP 中的价值会更清晰
Google AI Pro 会员
工具与基础设施:Google 账号与会员策略
渠道主张:只推荐官方 Google ai 会员(Google ai Pro)
不要薅羊毛、不闲鱼买、不用假学生证 Google 账号=最重要的数字资产/互联网身份证 省 20 块导致封号、数据丢失,“极其愚蠢”
性价比算账(用“价值回收”说服)
Google 为抢市场每年烧数百亿美金 20 美金/月,含 NotebookLM 专业版、nano banana pro 权限、Deep Research、gemini 3.0 Pro 等 支持 6 人家庭组共享,摊薄后很便宜 对比:nano banana pro 生图 API 约 1 张图 1 元人民币 如果会员每天生成 20 张图≈值 20 元;一个月≈600 元
生态长期价值:Google 的“全家桶打通”
Drive/Docs/Slides:文档与 PPT 可被 ai 直接读 YouTube:视频内容也能被理解 结论:放得越多、打通越好,价值越大 → 要好好“养”一个 Google 账号
高级修图:Figma ai(针对“汉字错乱”等问题)
20 美金一个月;只有专业人士需要考虑; 局部重绘与按图层编辑:“Edit with prompt”:可替换背景、改颜色(可调用 gemini 3.0 Pro 或 GPT Image 模型 *原话如此表述)
关键能力:把图片元素分割为独立图层; 可自己加字,避免乱码;
ai only, only ai
社群体系:ai 社群与大会员
“only ai”的社群定位
面向只为 ai 而来的人:不关心过去费曼/内驱等内容,只要 ai 实用价值 社群核心引擎:Howie 持续分享、毫无保留、倾囊相授的 ai 内容 门槛与筛选:设置付费门槛作为基本筛选 权益:回看全部直播 + 文字稿 + ai 知识库 + 所有 Prompt 氛围:成员多为“实战派”,人均至少一两个顶级会员(chatgpt Plus / Google ai) 警告:若只用免费模型(如豆包),很多高级用法实现不了,会误判“ai 不行”
大会员:全集与子集
关系清晰:ai 社群是大会员的子集;大会员是小能熊的全集 大会员覆盖:ai + 十年内容积累 + “三位一体共建学习型家庭” + 面向 ai 时代的解决方案
本周 ai 精进:学习篇
模型差异与前沿新知
多模态能力差异:同一道题,不同“解题姿势”
例子:2022 高考数学最难几何题 GPT 路径:放大缩小 + Python 切割图片 + 调一堆工具 → 五六分钟/七八分钟也能做对;GPT-5 Thinking 能做对,但更像“工具链解题”; gemini 3.0 Pro:十几秒解决;多模态强,拿到图片“看懂就直接推下去”,少外部操作;
强调:不是谁更聪明,而是处理信息方式不同 GPT 某些场景靠工具补足“看图做题”链路; gemini 在多模态输入更顺手(音频/图片/视频直接扔进去就能理解;输入输出都通);
nano banana pro 与 gemini 3.0 Pro:不是 unified model
判断:两者目前不是同一套参数/同一个统一模型 更像不同方向的 checkpoint 分支(保存点)各自演进,还未统一 类比 Openai:年初 Sam Altman 说 GPT-5 会是 unified,不 routing;但目前仍呈现分化的界面与能力形态; 用意:提醒做 workflow 设计时要把“工具组合”当现实前提。不要假设一个模型包打天下。
NotebookLM 的 PPT 功能:为什么“点按钮”不够
观点:只有你全程把控 workflow,才能注入 idea / taste / 真正想表达的东西; 自动一键生成:很难产出“有灵魂”的内容;求知欲弱、注意力涣散的人随手点按钮 → 大概率得不到好东西 结论:你用 workflow 做的 PPT,可能比市面上收几万做 PPT 的团队更专业。一定好于“点一下按钮出成品”(包括 NotebookLM 的按钮成品)。
前沿新知:Alpha Evolve(混个眼熟)
Google 最近内测新模型:Alpha Evolve 思路:利用进化论(Evolution)来设计算法的 Agent 特点:问题定义清楚 → 用“生物演化”的方式不断迭代算法 定位:新动态,先建立概念;
本周 ai 精进:实践篇
Reads:万物皆可读
从“高带宽阅读”到更可持续的命名:Reads
过去说法:三级笔记 Pro → 高宽带阅读 / super reading; 现在更推荐:单独起系列 reads;目的:不把阅读限定为书; 统一口径:podcast 是阅读,知识视频是阅读,网页是阅读,书也是阅读。“互联网阅读,一切的阅读”
案例:谢洛夫斯基(Terrence Sejnowski)访谈
来源:《知识分子》公众号长文访谈 背景连接:他写/推荐的《深度学习》发展史相关书“非常值得读” 方法:长文直接丢给 GPT-5.2 (Thinking) 或 gemini + “三级笔记” Prompt; 产出:结构化提取关键概念。例:玻尔兹曼机、大语言模型、缸中之脑、反向图灵测试、生物智能等; 用法:复制进 Logseq。虽没逐字读,但“提取的知识结构、建立的关联”反而更强。
突破语言障碍:Openai 技术博客
英文、晦涩内容过去读起来费脑且难提炼 现在:用最好的 Prompt + 最好的 ai,用 Token 把认知负荷“买下来”; 延伸表达:实现 “Hacker News 自由”(硬核内容也能轻松消化)
演示流程:Readwise Reader → GPT-5.2 → Logseq 路径化
获取素材:Readwise Reader 里的内容(含 Openai Podcast,自动生成高质量文字稿) 调用 ai:GPT-5.2 (Thinking) 切最大算力,执行“三级笔记” 建立路径:Logseq 建立 [[Reads/2025/W50]](第 50 周读的内容) 抓取结构:链接/内容丢给 ai → 输出线性结构/概念框架 主动构建:遇到不懂概念(如 Post-training、RLHF、PPO);让 ai 解释 → 转成单独 Page;若知识库已有笔记 → 直接建立连接; “Chat with Knowledge”:笔记同步到 Google Drive → gemini 可直接读;等于 “Chat with your personal knowledge management”;“伟大”“感动到哭”。
核心逻辑:从线性输入到树状重构:无论上课/看书/读文章/听 podcast/看视频,本质一致;孩子学习与成人学习也一致;学习真正走到:提取—结构化—可复用(输入只是第一步);
本周 ai 精进:思考篇
向 ai 要价值,也向学习要价值
双重总纲:向 ai 要价值 + 向学习要价值
小能熊十年核心不止 ai:还包括内驱式学习、科学学习; 判断:ai 越强,学习的价值越重要。
荒诞现实与教育之痛:问题根源是“低效”
海淀现状:小学生早 6/7 点上学,下午放学后进教培,晚 8 点才出;价格约 800 元一节课;每周 7/8 节(花钱且孩子累)。含辛茹苦学十几年,最终有什么用? 归因:学习本身没错(上课/做题/数理化没错),错在低效。落后方法、落后工具、错误指导思想 → 极低效学习过程 家庭层面的目标:用更少时间取得更好效果、发展更好智能、培养内驱力 → 孩子才能快乐。小能熊以家庭为单位,为儿童快乐而奋斗。
终极希望:技术进步带来“智能富足”
进入“智能富足”时代:最顶级智能每月只需 20 块钱 愿景:清澈透明的世界。不需要人剥削人;不牺牲儿童健康与快乐;不牺牲年轻人生活权利;不再有人为几毛钱在冬天受冻。 信念表达:对 ai 的兴奋接近一种“信仰”——解决“看不到头”的问题的终极方向。
ai 与教育:打破生物大脑的局限
ai 的杀手级应用(在他眼里)是教育:反对把价值放在“生成庸俗的感官内容”;真正价值:让知识、结构、概念更清晰、更可理解、更可迁移; 从“劝人学习”到“学习可落地”的历史变化: 过去十年布道:理念都对,但很多人“听懂了更痛苦”; 类比:洞穴里叫醒的人看见清醒现实却解决不了; 欠债:家庭环境欠债、预训练欠账、应试欠账、推理欠账 曾经的切肤之痛:“劝人学习如同杀人放火” 现在不同:ai 成为“第四层大脑皮层” 每月几十块钱拥有最强且越来越强的 ai 不是外置玩具,而是认知系统的一部分 统一方法:做 PPT/信息图/阅读/写作,用同一套方法把 ai 变成“第四个大脑”
展望:2026–2030 的“五年AI之约”
判断:从 2026 到 2030 世界将发生巨变 呼应:2020 提出的“十年挑战”,两周后将进行第六年的跨年对谈 投资隐喻:投资时间与注意力在学习方法与 ai 上;类比几年前投资英伟达,可能带来上百倍回报; 价值三件套:拥抱 ai、学习、家庭 → 未来才有希望;
Q&A
gemini会员能否取代 chatgpt 会员?
结论:gemini 的 20 美金要花(生态 + 生图),chatgpt 的 20 美金也尽量花(Atlas 浏览器内置 GPT-5 等体验最好); 举例:三级笔记 Prompt 在 gemini 侧需要复制粘贴、转 Markdown、整理链接,繁琐;在 chatgpt atlas 里面就不需要,直接 chat with 一切网页;
讲座回看&下期预告
加入”做中学·ai社群“,即可获得以下全部权益:
chatgpt发布三年来,我首次招募ai社群,就是因为现在是 ai 最可以也最应该落地的时刻。
首次招募,拼团只需365 元,还赠送 129 元《内驱式学习》签名书。数量有限,先到先得。
点击链接🔗,或者”阅读原文“,现在加入社群。