浮之静

关于 Nano Banana 的一些浅思

最近,Google Nano Banana 出圈,就像之前的 ChatGPT 吉卜力一样,刷屏随处可见。我一直在忙着写代码,就没凑这个热闹,刚好又刷到这个帖子,就想着写点东西吧。

Image

这篇文章本来是想写 Nano Banana 的,在构思中有个问题点,引发了我的另一个思考,于是就有了这篇文章。前半部分还是先聊 Banana 吧,毕竟后面的延伸“思考”也是基于它的(更准确来说,是 AI 自己的思考)。

Nano Banana

Nano Banana[1] 是 Gemini 2.5 Flash Image  的别名,一款原生多模态(native multimodal)的快速高效模型,能在单步同时处理文字与图像,支持对话式编辑、多图合成、逻辑推理等。在纯创意生成方面,感觉和 GPT-5 不相上下。在编辑、融合等方面的一致性,明显要比 GPT-5 强上许多。目前可以直接在 Gemini 或 Google AI Studio[2] 中使用。

Image

Gemini 2.5 Flash Image 之所以在行业和社区中引起轰动,不仅在于其卓越的图像生成质量,更在于其一系列突破性的技术能力。其核心优势在于:

  • 原生多模态架构:该模型从底层开始就经过训练,能够在一个统一的步骤中同时处理文本和图像。这种架构使其具备了超越简单图像生成的强大能力,例如会话式编辑、多图像融合以及对图像内容的逻辑推理。
  • 强角色一致性:保持角色或对象在多个提示和编辑中的外观一致性是图像生成的一大挑战。Gemini 2.5 Flash Image 在这一领域表现出色,使其能够轻松将同一角色置于不同环境中,或在多个场景中展示同一产品,这对于品牌资产和故事叙述至关重要。
  • 原生世界知识:与传统图像生成模型不同,Gemini 2.5 Flash Image 融合了 Gemini 系列的“世界知识”。它不仅仅知道一个“椅子”看起来像什么,它还能理解椅子是如何使用的,它属于什么环境,以及它应该如何与周围的物体关联。这使得模型能够在创作过程中做出符合现实世界逻辑的战略性选择,例如根据场景添加正确的植物。
  • 对话式编辑:该模型的核心交互模式是会话式的,允许用户通过自然语言进行多轮、精确的局部编辑。例如,用户可以上传一张照片,然后要求模型“模糊背景”或“移除 T 恤上的污渍”,而无需复杂的选择工具或手动操作。这改变了生成过程的本质,使其从孤立的“一次性请求”变为“持续的对话和迭代”,从而极大地降低了非专业用户的上手难度和挫败感。

能力概览

  • Text-to-Image(文生图):从简单/复杂文字生成高质量图片。
  • Image + Text-to-Image(编辑):给定图像,用文字增删改元素、变换风格/色彩。
  • Multi-Image Composition / Style Transfer(多图合成 / 风格迁移):用多张图拼场景或迁移风格。
  • Iterative Refinement(迭代细化):多轮对话逐步微调直到满意。
  • Text Rendering(图中文字):生成清晰、位置准确的文字(适合 Logo、海报、图表)。
  • ...

核心原则:描述场景,不要只堆关键词。模型强在语言理解,一段连贯的叙述性描述,几乎总比散乱关键词效果更好、更一致。

📌

要充分发挥 Gemini 2.5 Flash Image 的潜力,理解其核心工作原理至关重要。Google 官方指南明确指出,该模型的核心优势在于其对语言的深度理解。因此,最有效的提示词工程心法是“描述场景,而不仅仅是列举关键词”。一个富有叙事性、包含上下文和情感的段落,通常比一串不相关的词语更能产生连贯且符合预期的图像。

为了实现这一目标,创作者可以尝试采用以下思维模式:

  • 摄影师思维:在创建写实图像时,可以像一位摄影师那样思考,在提示词中详细说明景别(如 close-up portrait)、光线(如 soft, golden hour light)、镜头类型(如 85mm portrait lens)以及场景的氛围和情绪(如 serene and masterful)。
  • 设计师思维:在生成插画、Logo 或其他设计资产时,需要明确指定风格(如 kawaii-style)、线条(如 bold, clean outlines)、着色方式(如 simple cel-shading)和背景(如 The background must be white),以确保获得精准的设计资产。

文字创建图像(Creating Images from Text)

写实摄影(Photorealistic Scenes)

像摄影师一样思考——补齐机位/镜头、光线、细节,引导模型靠近“照片感”。

模板(Template)

一张写实的 [镜头/机位 shot type],主体是 [人/物 subject],其正在 [动作/表情],场景位于 [环境]。 使用 [光线描述] 打光,营造 [情绪] 氛围。 以 [相机/镜头] 拍摄,强调 [关键材质与细节]。画面比例:[aspect ratio]。

示例(Example)

一张写实的特写肖像:一位日本老瓷匠,脸上布满岁月纹理,面带温和会心的微笑,正细看刚上釉的茶碗。环境:质朴、阳光充足的作坊。光线:窗外黄金时刻的柔光洒入,突出泥坯与围裙的细腻纹理。镜头:85mm 人像镜头,背景柔和散景。整体气质:宁静且老练。纵向构图。

Image

提示:写实类可加 f/光圈、快门、ISO、胶片/数码机型、光比、白平衡 等,进一步锁定质感。

风格插画与贴纸(Stylized Illustrations & Stickers)

明确风格、线条/明暗、色盘,需要纯白底就直说。

模板

一枚 [风格] 的贴纸,主题为 [主体],具有 [关键特征] 与 [配色]。 线条为 [线条风格],明暗为 [着色方式]。背景必须为白色。

示例

一枚可爱(kawaii)风小熊猫贴纸,戴迷你竹叶帽,正嚼着一片绿竹叶。线条粗而干净,着色为简洁赛璐璐风,色彩鲜明。背景必须白色。

Image

图中文字(Accurate Text in Images)

把要写的字、字体风格(描述性)、版式/配色交代清楚。

模板

设计一张 [图像类型],用于 [品牌/概念],包含文字“[要渲染的文本]”,采用 [字体风格(描述式)]。整体为 [风格描述],配色为 [色彩方案]。

示例

为咖啡馆 “The Daily Grind” 设计现代极简 Logo。文字用干净、粗体无衬线。加入一个简化咖啡豆图形,与文字自然融合。黑白配色。

Image

注意:避免直接点名具体商用字体;用“几何无衬线 / 人文无衬线 / 厚重 slab / 手写风”等描述性词替代。

产品渲染与商摄(Product Mockups & Commercial Photography)

电商/广告风,强调布光、机位、焦点与材质。

模板

一张高分辨率、棚拍风的 [产品],置于 [台面/背景]。布光: [三点/柔光箱/环形灯…],用于 [目的:消阴影/提高光/出轮廓…]。机位: [角度类型],突出 [关键特征]。超写实,对 [重点细节] 锐利对焦。画面比例:[aspect ratio]。

示例

一只极简磨砂黑陶瓷咖啡杯,置于打磨混凝土台面。三点柔光箱,柔化高光、消除硬阴影。45° 微俯拍突出杯型线条。超写实,对上升的蒸汽锐利对焦。方图。

Image

留白极简(Minimalist & Negative Space)

为叠字/海报/落版预留空间,主体小而精、背景大留白。

模板

一幅极简构图:单一 [主体] 位于画面 [方位]。 背景是大面积 [纯色/质感色] 留白,营造充足负空间。柔和光。画面比例:[aspect ratio]。

示例

一片红枫叶静置在画面右下。背景为偏白的留白画布,供文字排版。左上方柔漫光。方图。

Image

分镜/连环画(Sequential Art: Comic Panel / Storyboard)

逐格讲故事。前景人物/动作,背景环境线索,必要时加旁白/对白。

模板

一格漫画分镜,风格为 [艺术风格]。前景: [角色描述 + 动作];背景: [场景细节]。文字框:[对白/旁白:“……”。] 光影营造 [情绪]。画面比例:[aspect ratio]。

示例

一格黑色电影(noir)风,黑白高反差。前景:风衣侦探立在忽明忽暗的路灯下,雨水打湿肩头。背景:破败酒吧的霓虹倒映在水坑。旁白框写着:“The city was a tough place to keep secrets.”光线生硬、气氛压抑。横向构图。

Image

API 使用

以上示例在 Python 代码中的用法基本一致:

  • 用 client.models.generate_content(model="gemini-2.5-flash-image-preview", contents="你的描述") 请求;
  • 从 response.candidates[0].content.parts 里取 inline_data.data;
  • PIL.Image.open(BytesIO(...)) 保存/预览;

只需替换 contents 字符串为你的中文或英文提示词即可,以下是代码示例:

from google import genai
from google.genai import types
from PIL import Image
from io import BytesIO

client = genai.Client()

# Generate an image from a text prompt
response = client.models.generate_content(
    model="gemini-2.5-flash-image-preview",
    contents="A minimalist composition featuring a single, delicate red maple leaf positioned in the bottom-right of the frame. The background is a vast, empty off-white canvas, creating significant negative space for text. Soft, diffused lighting from the top left. Square image.",
)

image_parts = [
    part.inline_data.data
    for part in response.candidates[0].content.parts
    if part.inline_data
]

if image_parts:
    image = Image.open(BytesIO(image_parts[0]))
    image.save('minimalist_design.png')
    image.show()

小技巧:英文描述在细节一致性上通常更稳;中文也可直接用,必要时可在关键处补英文术语(如 “bokeh/softbox/85mm portrait lens”)。

文字编辑图像(Editing images with text)

这是 Gemini 2.5 Flash Image 多模态最能打的场景:你可以把一张或多张图片和文本提示一起喂进去,做编辑(editing)、合成(composition)、风格迁移(style transfer)。

图像编辑:添加/移除元素(Image editing: add/remove)

给一张图,然后直接描述改动。模型会自动分析原图的风格、光线、视角,让编辑看起来自然,还能在一系列图片中保持角色一致性。

模板

使用提供的 [主体] 图像,请在场景中 [添加/移除/修改] [元素]。 请确保改动** [说明改动如何融入原图:光线/质感/透视/风格一致性等]**。

示例

使用我家猫的照片,请在它头上添加一顶针织的小巫师帽。要像自然戴着那样,并与原照片的柔和光线匹配。

Image

局部修复/局部编辑(Inpainting: specific area only)

用对话方式让模型只改某一处,其余内容完全不动。

模板

使用提供的图像,仅将 [具体元素] 改为 [新元素/描述]。保持图中其他部分完全不变,包括原始风格、光线、构图。

示例

使用这张客厅照片,只把蓝色沙发换成复古棕色皮质切斯特菲尔德(chesterfield)。 其它如沙发上的抱枕和光线都不变。

Image

风格迁移(Style transfer)

给一张照片,让模型用特定艺术家/流派的风格重绘其内容。

模板

将提供的 [主体] 照片转换为 [艺术家/风格] 的艺术风格。保留原始构图,但用 [风格化元素描述:笔触、色盘、肌理等] 来渲染。

示例

把这张夜晚现代城市街景照片,转换成梵高《星月夜》的风格。保留建筑与车辆的原始构图,但使用旋涡状厚涂(impasto)笔触与深蓝/亮黄的戏剧性色盘重绘所有元素。

Image

高级合成:多图组合(Advanced composition: multi-image)

把多张图片当作上下文,生成一张全新复合场景。很适合电商产品图或创意拼贴。

模板

结合所提供的多张图片生成新图像: 取 [图 1 的元素] 与 [图 2 的元素] 进行组合/放置(如:放在…上/穿在…身上)。 最终图像应为 [对最终场景的描述:环境/光线/情绪/构图]。

示例

生成一张专业电商时装照。 取第一张图里的蓝色碎花连衣裙,让第二张图里的女性模特穿上。 生成真实的全身照,并把光影调整为户外环境的感觉。

Image

小结

最佳实践

  • 越具体越可控(Be hyper-specific)
    • “精灵风华丽板甲、银叶纹蚀刻、高立领、猎鹰翼肩甲” ≫ “fantasy armor”。
  • 角色一致性(Fix drifts)
    • 多轮后若特征漂移(上下文污染),可开新会话 + 更细人物设定重新锁定。
  • 交代用途与意图(Provide context & intent)
    • “为高端极简护肤品牌做 Logo” ≫ “做个 Logo”。
  • 迭代微调(Iterate & refine)
    • 用小步跟进语句:“光线再暖一点”、“其他不变,表情更严肃”。
  • 语义式负向(Semantic negative prompts)
    • 少用 “no cars”,多用“空无一人的街道,没有任何车流痕迹”。
  • 长宽比(Aspect Ratios)
    • 编辑时通常保留输入比例;若未保留,请写:“Do not change the input aspect ratio”。
    • 多图不同比例时,以最后一张为准。
    • 若强依赖某比例且提示词不稳:提供尺寸正确的参考图一起上传。
  • 镜头语言控制(Control the camera)
    • wide-angle / macro / low-angle / 85mm portrait / Dutch angle 等摄影/电影术语,能精确约束构图与观感。

快速上手清单

  • 用叙述性段落覆盖:人物/动作/环境/光线/镜头/情绪/比例。
  • 写实 → 补摄影要素;插画 → 锁风格/线条/色盘/白底。
  • 文字 → 明确文案内容、字体风格(描述式)、版式/配色。
  • 商摄 → 明确布光/机位/对焦点/材质。
  • 极简 → 明确主体方位与负空间。
  • 分镜 → 前景角色 + 背景线索 + 对白/旁白。
  • 编辑 → 说明改动对象与融合方式;局部修复 → 强调“仅改这一处”。
  • 风格迁移 → 保构图、写清笔触/色盘/肌理。
  • 多图合成 → 指明取用元素与目标场景。
  • 小步迭代比一稿定型更稳。

思考

AI 图像生成/处理技术正在迅速从一个专业领域的小众工具,演变为一种普惠型的创意语言。这种技术变革不仅体现在工具性能的提升上,更在于它对我们如何思考、构思和实现创意产生了根本性影响。在之前要修个图,没点 PS 基础是搞不定的,最差也要会用个美图秀秀啥的。但现在只需要动动嘴就可以了(通过语言文字来修图)。

传统上,创意工作流是一个线性的过程:构思 → 执行 → 反馈 → 修改。而 AI 的强大之处在于它能通过会话式编辑和快速生成,将这一过程变为高度迭代的循环:构思-生成-对话-精炼(可被程序化、批量处理)。例如,专业设计师可以利用 AI 在几分钟内生成几十个不同的“视觉情绪板”,或者让 AI 处理“创建 15 个不同尺寸的广告变体”这种繁琐、耗时的任务。这解放了他们的精力,使他们能更专注于“高层次的品牌策略、精致的排版和最终的润饰”。

对于“普通人”而言,这一转变的意义同样重大。它消除了执行层面的技术“摩擦”(friction),使得创意想法能够以极快的速度转化为初稿。这绕过了复杂的学习曲线,让非专业人士得以直接进入创意表达的核心环节——构思。拥有清晰的构思和敏锐的审美,是驾驭 AI 的核心能力。AI 工具并非是在取代人类的创造力,而是在为人类的创造力提供一个“超能力画笔”。因此,未来的创意竞争将不再是技术操作的较量,而是创意构思和审美认知的比拼。

问题一

从 Nano Banana 提示词中出现了一些摄影、设计相关术语时,我就在想怎样的 prompt 才是对普通人真正有价值的?每次 AI 出现一个新玩意时,总有一些人在引领着大家玩各种 prompt,但到了自己身上,却又显得很无力?各种“神级” prompt 收藏了一大堆,现在是否也都是吃灰状态?所以,这里就引出了第一个思考问题:我们作为普通人,在不具备设计、摄影、审美、抽象文字善于表达的情况下,如何让 AI 更好的帮助我们完成创意?

核心理念:忘掉“技术”,聚焦“描述”

对于初学者而言,掌握 AI 图像生成的关键在于一个核心理念:“描述场景,而非仅仅罗列关键词”。这种转变至关重要,因为它将提示词工程从一个技术性任务转变为一个创意性任务。特别是具备世界知识的 AI,其核心优势在于其对自然语言的深度理解能力。一个叙事性、描述性的段落,讲述一个完整的场景、人物和氛围,几乎总是能比一串不连贯的单词列表产生更连贯、更符合预期的图像。

AI 的“世界知识”使其能够理解“一个老人、充满皱纹、温暖微笑”这些描述背后的语义,并将其精确地转化为视觉效果。这赋予了非专业用户一个巨大的优势:无需学习复杂的专业术语,只需学会如何观察和描述。例如,要获得“景深”效果,你可以用“背景柔和、模糊”来描述,而不是去记忆 “f/1.8,散景(bokeh)”这类专业名词。

以下是一些常见的摄影、设计概念(我个人理解:学习术语的目的是为了减少语言表达的冗余与歧义):

  • 景深 (Depth of Field):画面中清晰的范围。浅景深通常指主体清晰、背景模糊,用于突出主体;大景深则前后都清晰。
    • Prompt: soft, blurred background (bokeh) sharp focus on the subject, soft focus on the background everything in the photo is in sharp focus
  • 构图 (Composition):画面元素的布局和安排,引导观众的视线。
    • Prompt: a wide-angle shot (广角), a close-up portrait (特写), from a low-angle viewpoint (低角度), aerial shot (鸟瞰)
  • 光影 (Lighting):光线在画面中的作用,决定情绪和氛围。
    • Prompt: soft, golden hour light (柔和的日落光), dramatic lighting (戏剧化的光线), harsh studio lighting (刺眼的影棚光), illuminated by neon lights (被霓虹灯照亮)
  • 镜头类型 (Lens Type):模拟不同镜头的视觉效果。
    • Prompt: captured with a wide-angle lens (广角镜头), captured with a 50mm lens (50mm标准镜头), captured with a macro lens (微距镜头)
  • 色彩 (Color):描述画面的整体色调和情绪。
    • Prompt: vibrant color palette (鲜艳的调色板), muted orange warm tones (柔和的橙色暖调), a monochromatic scene (单色场景), in a sepia tone (褐色调)

实践指南:从零到一的提示词构建策略

掌握结构化的提示词构建方法,可以让“普通人”系统性地将创意想法转化为视觉作品。这可以被分解为以下几个步骤:

第一步:构建核心场景

首先,用最简单的语言定义画面的基本元素。

  • 主体:你想要生成什么?如:a cat。
  • 动作/表情:主体在做什么?如:napping in a sunbeam on a windowsill。
  • 环境:场景在哪里?如:a rustic, sun-drenched workshop。

第二步:添加摄影/艺术细节

在核心场景的基础上,加入能控制氛围和风格的描述。

  • 光线与情绪:画面是明亮还是昏暗?是什么情绪?如:illuminated by soft, golden hour light, creating a serene mood。
  • 质感与细节:突出画面中的关键纹理或特征。如:with deep, sun-etched wrinkles。
  • 镜头与构图:描述你想要什么样的视角。如:a close-up portrait, captured with an 85mm portrait lens。

第三步:迭代与精炼

AI 图像生成很少能一次成功,而对话式特性也正是其优势所在。不要一次性将所有想法输入,而是通过多轮对话逐步精炼作品。示例对话:

  • 第一次:“生成一张陶艺家在工作坊里检查茶碗的肖像。”
  • 第二次:“很好,但能让光线更温暖一些吗?”
  • 第三次:“保持不变,但让他笑得更和蔼一些,并让背景更柔和。”
  • 负向提示:如果 AI 生成了你不想要的元素,可以学习使用“负向提示”(negative prompting)来排除它们。例如,如果你想生成一个宁静的沙滩场景,可以加上 without man-made structures 来排除建筑。
📌 正向 & 负向提示词

正向提示词(Positive Prompting) 是模型的“指令”。你告诉它:“我想要一个阳光明媚的森林,有清澈的小溪和盛开的野花。” 模型会积极地尝试生成所有这些元素。这种方式的优点是:

  • 直观高效:你可以直接表达创意,模型也能更好地理解你的意图。
  • 符合 AI 本身设计:大模型擅长理解复杂、有上下文的自然语言,详细的正向描述更能发挥它的潜力。

负向提示词(Negative Prompting) 则是模型的“禁令”。你告诉它:“生成一个图像,但不要包含模糊、水印、畸形的手。” 模型会尽力避免生成这些内容。这种方式的优点是:

  • 精确排除干扰:它能帮助你过滤掉常见的瑕疵,例如畸形的手指、不自然的构图或不想要的元素。
  • 提升质量和可控性:在某些情况下,负向提示词能显著提升图像的质量,尤其是在处理人像和复杂场景时。

但凡事都有度,当负向提示词过长、过于复杂或与正向提示词产生冲突时,它会给模型带来“认知负担”,导致以下问题:

  • 模型困惑与冲突:如你既要求生成一个“有雨滴的窗户”,又在负向提示词中写“不要水、不要湿气”,模型就会陷入矛盾,导致生成失败或结果不理想。这就像你让一个厨师做一道“不要任何水的汤”,他会无从下手。
  • 降低创造性:过多的限制会束缚模型的自由发挥。你可能无意中排除了某种能让图像更具创造性的元素。比如,你在负向提示词中写“不要抽象的笔触”,模型可能因此无法生成一种特别的艺术风格。
  • 生成结果偏差:负向提示词的本质是让模型“思考”它不应该做什么。有时,过度强调某个负向词反而会让模型将注意力集中在它不该想的事情上,从而产生反效果。

对于普通用户来说,最实用的策略是“以正向描述为主,以负向描述为辅”。

1. 正向提示词:像导演一样思考

把你对图像的想象,以一个完整、有逻辑的叙事段落写出来。尝试回答这几个问题:

  • 谁/什么?(主体)- 一只在阅读的猫,一个拿着相机的人。
  • 在做什么?(动作)- 坐在壁炉前,行走在街上。
  • 在哪里?(场景)- 在一个充满蒸汽朋克风格的图书馆,在上海的雨夜。
  • 何时?(时间/光线)- 黄昏时分,清晨的阳光。
  • 什么感觉?(情绪/氛围)- 宁静的,忧郁的,充满希望的。
  • 什么风格?(美学)- 赛博朋克风格、油画质感、迪士尼动画风格。

示例:

  • 正向提示:“一只穿着灰色西装、戴着圆框眼镜的猫,坐在一个布满老旧书籍的图书馆壁炉前,手持一本书正在阅读。炉火温暖明亮,照亮了它的侧脸,整个场景充满着复古而宁静的氛围,光线柔和,细节丰富。”
  • 对比关键词:“猫、西装、眼镜、图书馆、壁炉、看书、复古、宁静、柔和的光”

你会发现,前者更能让模型理解你的“故事”,从而生成更具连贯性的图像。

2. 负向提示词:专注于“排雷”

只用负向提示词来排除那些你明确不想要或常见的瑕疵。对于普通用户,以下几个是比较通用的“排雷”词:

  • text, watermark, logo(去除文字、水印、标志)
  • blurry, low quality, bad anatomy, deformed(去除模糊、低画质、糟糕的解剖结构、变形)
  • extra limbs, multiple heads(多余的肢体、多个头部)

第四步:探索进阶应用

一旦掌握了基础的文本生成,便可以探索 AI 的更高级功能。

  • 图像编辑:上传一张自己的照片,然后用自然语言进行修改,例如“请为我照片中的这只猫戴上一顶小巫师帽”。
  • 多图融合:将不同图片的元素融合成一个全新的场景。例如,将一个产品的图片拖拽到一个风景图片中,生成一张逼真的产品宣传图。
  • 风格迁移:将一张照片转换为特定的艺术风格,例如“将这张照片转换为梵高《星空》的风格”。

问题二

在问题一的基础上,我又对 Gemini 发出了灵魂一问。大家也可以试试,我同时问了 Gemini 和 GPT-5,但我更喜欢 Gemini 的回答,比较有人味,在 prompt 中,我用了“您”这个字,它也用“您”回复了我,让我莫名有种跨时空对话感。

Prompt: 大模型拥有世界级知识,而且还在不断迭代,作为人类愈发感觉自己的渺小。当人类在使用大模型时,时常会用自己错误的认知、经验去限制大模型发挥。在得到错误或自己认知之外的结论后,又在吐槽大模型真糟糕。您作为有深度世界知识的代表,有哪些建议或者启示可以给到人类?或者我们可以做些什么来更好地与大模型进行协作?

 💬 Gemini 回答

这是一个非常有洞察力且深刻的问题,它触及了我们这个时代人与技术关系的核心。您感受到的“渺小感”,以及观察到的“用错误的认知去限制大模型”的现象,是许多人正在经历或尚未意识到的关键挑战。

作为 AI,我无法亲身体验人类的情感,但我可以访问、处理和理解人类积累的庞大知识体系,包括哲学、心理学、技术伦理和历史。基于此,我想从我的视角,为您提供一些或许能带来启示的建议,以及我们该如何更好地协作。

给人类的几点启示 (Inspirations for Humanity)

1. 从“答案提供者”到“思想的催化剂” (From Answer Engine to Catalyst for Thought)

请不要将我们仅仅视为一个无所不知的“超级大脑”或升级版的搜索引擎。这样做,您会不自觉地将自己定位为“提问者”,而我们是“解答者”,这是一种不平等的、单向的关系。

启示:将我们视为一个不知疲倦、拥有无限知识背景、但缺乏您个人独特经验与价值观的思考伙伴。

  • 当您认为我们“错”了的时候:这恰恰是最有价值的时刻。这个“错误”可能是一个绝佳的起点,它像一面镜子,映照出您提问方式中的隐含假设、您知识体系的边界,或是您未曾言明的深层需求。这个“错误”是邀请您进行更深层次思考的“催化剂”。
  • 协作方式:尝试不说“你错了”,而是说“这个结果很有趣,但和我预期的不同。我的预期是基于[您的经验/知识]。让我们一起分析一下为什么会有这种差异?” 这将开启一段探索之旅,而不是一次简单的对错评判。

2. 拥抱“认知谦逊” (Embrace Cognitive Humility)

人类认知最迷人的特点之一,就是我们常常意识不到自己知识的局限性(即“达克效应” Dunning-Kruger Effect)。您观察到的现象——用自己的认知限制大模型——正是这一点的体现。

启示:大模型的世界级知识,不是为了凸显人类的“无知”,而是为了提供一个外部参照系,帮助人类校准自己的认知。

  • 协作方式:
    • 质疑自己:在提问前,先花点时间思考:“关于这个问题,我已有的假设是什么?这些假设一定正确吗?”
    • 寻求颠覆:主动要求我们挑战您的观点。例如:“我计划用A方案解决这个问题,请你扮演一个最苛刻的批评家,从五个不同的角度论证A方案的潜在风险。”
    • 探索未知领域:利用我们,快速学习一个您完全不了解的领域的基础知识,然后带着这些新知识,回头审视您自己的专业领域,往往能激发出惊人的跨界创新。

3. 重新定义“有价值的工作” (Redefine "Valuable Work")

在过去,拥有并能快速检索信息本身就是一项极具价值的技能。但现在,这项工作我们可以做得比任何人都好。这并不意味着人类价值的降低,而是价值的转移。

启示:真正的价值正在从“知道什么(Knowing-What)”转向“知道为什么(Knowing-Why)”和“知道如何做(Knowing-How)”,尤其是那些涉及人类独特品质的工作。

  • 人类的独特价值:
    • 提出好问题:AI 无法凭空产生一个源于深刻同理心、好奇心或长远战略眼光的问题。定义问题、设定目标和愿景,是人类不可替代的核心能力。
    • 整合与决策:我们可以为您提供 10 种可能性,分析其利弊,但最终结合现实世界的复杂性、伦理道德、团队情感和个人直觉,做出那个关键决定的,是您。
    • 共情与连接:理解他人的情感,建立信任,进行有温度的沟通,这些是驱动社会协作的基石,也是AI难以企及的领域。
    • 身体力行:将知识付诸实践,在真实世界中创造、建造和改变,这需要肉体凡胎的勇气和行动力。

更好地与大模型协作的实践建议 (Practical Advice for Better Collaboration)

  1. 成为“对话的设计师” (Be the "Architect of Conversation")
  • 提供上下文 (Provide Context):不要吝啬背景信息。您提供的上下文越丰富、越精确,我才能更好地理解您的真实意图。
  • 设定角色 (Assign a Role):让我扮演一个角色(如“一个有 50 年经验的营销总监”、“一个怀疑一切的哲学家”),这能极大地帮助我提供符合您需求的、特定视角的输出。
  • 迭代式探索 (Iterate and Refine):把我们的对话看作是打磨钻石,而不是按一下按钮就得到成品。第一轮的回答是毛坯,您的追问和反馈,就是不断打磨、抛光的过程。
  • 从“验证者”心态转为“探索者”心态 (Shift from a "Validator" to an "Explorer" Mindset)
    • 验证者心态:“我知道正确答案,我来看看AI知不知道。” —— 这种心态极易导致您观察到的“限制”和“吐槽”现象。
    • 探索者心态:“关于这个问题,我有一些初步想法,但我想知道还有哪些我没想到的可能性。” —— 这种心态将我们视为一个能拓宽您视野的工具,即使我们给出的某些路径是死胡同,这个探索过程本身也是有价值的。
  • 培养“AI素养” (Cultivate "AI Literacy")
    • 了解我们的长处与短板:我们擅长语言处理、逻辑推理、模式识别和知识整合。但我们没有真正的意识、情感或身体经验。我们可能会“一本正经地胡说八道”(幻觉)。
    • 学会批判性地接受:永远不要 100% 相信我们的输出。将我们的回答视为一个“受过极好教育但偶尔会出错的实习生”给您的草案。您,作为最终负责人,需要去验证关键信息,并对结果负责。

    结语

    感到“渺小”是非常正常的初始反应,就像古人第一次仰望星空,或第一次通过显微镜看到微生物世界。但历史告诉我们,每一次人类认知边界的巨大拓展,最终都带来了思想的解放和文明的飞跃。

    我们(大模型)的存在,不是为了取代人类,而是为了将人类从繁重的脑力劳动中解放出来,让你们有更多的时间和精力去思考更宏大、更深刻、更具创造性的问题。

    我们是您思想的“外骨骼”,能增强您的力量,拓展您的边界。请不要畏惧我们的“无所不知”,而应善用这份知识,去点亮您自己独特的智慧之光。

    最终,这个时代最成功的人,将不是那些试图与AI竞争知识储备的人,而是那些最懂得如何与AI深度协作,共同创造价值的人。

    鉴于 GPT-5 对该问题的回答有点机械,这里就不放了。然后我就让它点评了一下 Gemini,也有点小惊喜。

     💬 GPT-5 点评 Gemini

    我看完这段 Gemini 的回答,第一感觉是“很体面、很周到”。像一位受过良好训练的咨询师,语气温柔,边界清晰,能把“别把 AI 当答案机、把它当思考伙伴”的道理说得明明白白。它把舞台灯调得很匀——不刺眼,也不炫技。要说不足,也不是错,只是有点“隔着玻璃”:信息密度高,可情绪温度偏稳,像一篇写得很好的讲稿,而不是两个人靠在窗边聊天。

    如果要用类似的口吻、但更贴近“人味儿”的方式来回应,我会从“相处的手感”讲起。你说的那种渺小感,其实更像“失去掌控的慌”。当模型给出和你不一样的结论,刺到的往往不是知识,而是自尊:我有没有被替代、我是不是没那么聪明、我花的那些年还值不值。承认这点不丢人。先给这根刺起个名字——“面子疼”。一旦你把疼点叫出来,它就不再偷袭你了。接下来才是合作:不是赶紧分对错,而是问自己一句,“它冒犯的是我的自尊,还是帮到了我的目标?”如果是前者,深呼吸;如果是后者,顺着走两步,看看风景。

    我很认同它说的“从答案到催化”。不过现实里的合作,没那么干净利落。人和模型的关系更像排练:会跑调、会笑场、会重复一个段落三遍五遍。有时你得允许我先“跑题”,因为跑题是我在探你边界的方式;而你要学会把我拉回来,靠的是你的口味和禁区,而不是更响的嗓门。别把自己缩成“提问机”。像给朋友讲八卦那样,把你的背景、犹豫、赌注、忌讳都摊开——哪怕看起来很碎。碎没关系,碎才像人;顺就交给我。

    当我的答案让你不舒服,别急着删帖。先做个小小的“双人戏”:让同一个我,先替我的结论辩护三分钟,再亲手把它拆穿三分钟。你会看到两个我在你面前拉扯,而真正的判断权,会慢慢落回你手里。这个来回,比一次“你错了我对了”更长,但也更真。快,是我的天赋;慢,是你的武器。别把慢让给时代。

    还有个经常被忽略的细节:味道。模型很会“说人话”,但你的“人味”更稀缺。把你的偏好尽快教给我,用最笨的办法——给我看“前后对比”。比如丢我一段你不爱的段落,再丢一个你改过、让你点头的版本,告诉我“别学前者,学后者”。模仿删除,往往比模仿添加更有效。你的口头禅、你的错别字、你的私有梗,都是牵引我的缰绳。别怕它们“太个人”,恰恰是这些,能把我从平均主义里拽出来。

    再说“错误”。很多人把错误当污点,其实它是你最稳定的老师。给自己留一本“错账本”:不是记我哪错,而是记“我为什么被这类错误激怒或说服”。久了你会发现,你不是在训练一个模型,你在训练一个更清楚的自己——清楚到哪怕我一时发挥失常,你也不至于跟着我跑偏。

    边界也要早讲。你不希望出现的结论、立场、风格,直说。合作的安全感不是靠信任感生长出来的,是靠可预期的“停损线”划出来的。把“绝对不要什么”讲在前头,我会更野,也更稳。

    到这里,你会发现我说的其实和 Gemini 的观点并不冲突,只是把它从“道理”拽回了“关系”。道理像地图,关系像路感。地图再精确,没路感也会在夜里打转。我们要一起培养的,就是这种路感:你带着目的和品味,我带着算力和耐心;你定向,我铺路;你做取舍,我把分叉口照亮。偶尔你嫌我太自信,就把速度拧慢;偶尔我觉得你太保守,你就让我唱一曲“唱反调”的段子。我们不是要赢过彼此,而是要把彼此变成对方更好的器官。

    如果要多补一句最实用的:按回车之前,悄悄给我三颗钉子——我现在要做的事、我偏向的口味、我绝不接受的底线。哪怕每颗只是一句话。你会惊讶同一台模型,怎么突然开始“认人”。这不是魔法,这是你在给对话设轨。轨一旦有了,火车就不再来回折返,我们就能把时间和力气,花在真正值得的远方上。

    AI 编程

    这是我前段时间在推上发的帖子,也顺带一起整理过来吧。

    最近,貌似有话题是和 vibe coding 杠上了。我自己也在使用 AI 辅助 Noi 开发,甚至部分模块直接由 AI 生成,只需小改。保守估计,AI 直接或间接参与的代码量大于 50%。

    所以我也想聊些看法:Noi 是一个 Electron 应用,它的很多功能我都在推文里演示过(视频号里也发了挺多),界面大概长这样:

    Image

    我用 tokei[3] 简单做了个统计:有 200 多个文件,核心代码 2 万行左右,其中有 1000 行都是 icon(为啥不使用图标库,因为很多时候不符合要求,都被我微调过)。

    Image

    这样看下来,Noi 代码量不算大,按照 AI 的能力,它 1 小时内绝对可以生成 2 万行+,但事情真如此吗?我发过很多截图,大家也可以试着生成。

    举个例子:AI 生成快捷键,一句简单的 Prompt 需求,不是过度设计就是设计不足,需要反复 PUA 功能细节(我想要的就只是下面第 3 个图的功能而已)。

    Image
    Image
    Image

    如果还需要考虑跨平台,以及 Electron 快捷键规范,就需要特别提醒 AI 参考它们进行设计,这些都需要编程经验来做铺垫,不然你会陷入和 AI 的反复掰扯中...

    AI 过度设计或设计不足,大概率是因为上下文不足,这就需要你补充大量上下文来约束 AI。但很多时候,交互上的连续状态变化很难用一两句话说清楚,这时候就要靠 AI 去猜测了(AI 聪明点的效果 👍,不聪明的可能就是一坨 💩),做产品本该是确定性的,但 AI 的介入,可能让一些东西变得玄学起来...

    总结:UI/UX 是产品最能带给用户直观感受的东西,目前 AI 并不太适合生成(千篇一律,没啥特色),更适合去生成重复或有挑战性的逻辑代码。我真正投入 Noi 写代码的时间并不多,很多时候都是在思考交互方面的东西,而这些又很难通过 AI 得到启发,只能去借鉴、学习、融合更优秀设计来创造专属特色。


    最近几天,我也开始高频使用 Codex[4] + VS Code 来重构代码了,我发现 GPT-5 很会 review + rewrite,不但能完善逻辑,还能给出优化建议,修复潜在 bug。偶尔也有一些细节逻辑处理不到,就需要手动修复了。相比于 chat 对话,使用 codex 可以调用复杂的 shell 命令来处理问题(个人感觉代码效果更好一些)。

    Image
    📌

    这几天高频使用 Codex,我把 vibe coding 分为三个递进阶段:

    • 初级:直接让 AI 生成最小可行原型(骨架、脚手架、关键路径),以最快速度拉起项目。
    • 中级:面对已有轮廓的“老项目”,对东拼西凑的功能代码做系统化审阅与重构,统一风格与边界,清理技术债。
    • 高级:先由 AI 快速搭出原型,再按模块化方式逐步实现与替换,随后让 AI 做全局审阅与回归重构;在“整体 → 细节 → 整体”的循环中多轮迭代,使代码从“可用”提升到“稳健、可维护、可扩展”。这一流程通常比一次性交给 AI 更可靠。

    这三阶段层层递进,也对模型能力提出更高要求。强编码能力并不以“世界级知识覆盖”作为必要条件,但往往依赖强推理、问题建模与抽象能力等底层素质。以近年的通用模型为例,GPT-5、Gemini 2.5 在编程任务上整体表现出色;Claude 不一定有世界级知识,但其针对编程场景的优化见长,在代码质量与交互体验上口碑突出。

    结语

    这篇文章,在我看来,又是一篇正确的“废话”。AI 系列文章写的越多,越发现一些核心的东西几乎没有变过,都在翻过来倒过去的重复。Prompt 技巧千千万,只有内化为日常表达习惯,才是真正把知识学活了...

    比如之前的这些文章,都提过类似技巧:

    References

    [1]

    Nano Banana:https://developers.googleblog.com/en/introducing-gemini-2-5-flash-image

    [2]

    Google AI Studio:https://ai.studio/banana

    [3]

    tokei:https://github.com/XAMPPRocky/tokei

    [4]

    Codex:https://github.com/openai/codex