歸
公众号

歸藏的AI工具箱

产品设计师AI画图工具操作员AI课程撰写与信息收集整理致力于发掘借助AI工具改善

790 篇已收录文章

这个来源的文章

按发布时间排序

刚才发了一个图文,给 Seedream 4.0 提示词加上 “IMG_2094.CR2”,会提高图像生成质量,我试了一下是有效的,大概解释一下原因:\n\nCR2、ARW、RW2 这种格式都是相机拍摄的 RAW 格式分支,其中 CR2 是佳能特有的 RAW 格式,还有 CR3。\n\n这些文件名称经常被图片上传到网站时候的各种描述、alt 文本、贴子正文里,然后在被爬取训练数据的时候写到图像对应的标签里面去。\n\n文本编码器在预训练时就学到了“CR2/ARW/RW2=相机RAW=高画质/高动态范围/真实光学特征”的强关联;把这样的标记塞进提示词,会把生成分布推向摄影真实感这一簇,从而提升微细节和光影质感。\n\n像 “.CR2” 这类在词表中较稀有但语义非常“聚焦”的 token,会成为嵌入空间里的强方向向量,能明显改变注意力分配与条件分布,比如把模型从“插画/绘画”拉向“数码相机 RAW 照片”。\n\n所以理论上我们可以看到,其他类似\nIMG_####.CR2 / DSC0####.ARW / P1######.RW2 / _DSF####.RAF / DNG ####,这种格式应该都会起作用。\n\n而且打标细致的话,你可以更换后面的后缀来使得生成的图片具有各种品牌相机的成像效果。

阅读全文 :刚才发了一个图文,给 Seedream 4.0 提示词加上 “IMG_2094.CR2”,会提高图像生成质量,我试了一下是有效的,大概解释一下原因:\n\nCR2、ARW、RW2 这种格式都是相机拍摄的 RAW 格式分支,其中 CR2 是佳能特有的 RAW 格式,还有 CR3。\n\n这些文件名称经常被图片上传到网站时候的各种描述、alt 文本、贴子正文里,然后在被爬取训练数据的时候写到图像对应的标签里面去。\n\n文本编码器在预训练时就学到了“CR2/ARW/RW2=相机RAW=高画质/高动态范围/真实光学特征”的强关联;把这样的标记塞进提示词,会把生成分布推向摄影真实感这一簇,从而提升微细节和光影质感。\n\n像 “.CR2” 这类在词表中较稀有但语义非常“聚焦”的 token,会成为嵌入空间里的强方向向量,能明显改变注意力分配与条件分布,比如把模型从“插画/绘画”拉向“数码相机 RAW 照片”。\n\n所以理论上我们可以看到,其他类似\nIMG_####.CR2 / DSC0####.ARW / P1######.RW2 / _DSF####.RAF / DNG ####,这种格式应该都会起作用。\n\n而且打标细致的话,你可以更换后面的后缀来使得生成的图片具有各种品牌相机的成像效果。

这个词竟然可以提高 Seedream 4.0 的图像生成质量!

fofr 说给 Seedream 4.0 提示词加上 “IMG_2094.CR2”,就会提高图像生成的质量。 我做了几次测试,发现在使用 API 的时候,加上这个提示词生成图片的细节丰富度、质感以及美学确实会变好。 但注意别在即梦里用这个技巧,因为即梦有自动的提示词优化。

阅读全文 :这个词竟然可以提高 Seedream 4.0 的图像生成质量!

现在这些牛皮研究都不发论文改发博客了?Open AI 前 CTO Mira Murati 的新公司 Thinking Machines 发布重磅研究文章《战胜 LLM 推理中的非确定性》\n\n这篇文章中他们着力于解决从 LLM 几乎无法获得可以复现的结果的问题\n\n\n为什么大型语言模型会出现“非确定性”?\n\n模型的核心部分其实是“确定性”的:研究发现,大型语言模型在处理信息时,最核心的计算步骤本身是“确定性”的\n\n真正的罪魁祸首——“批次不变性”问题:问题出在模型如何同时处理多个请求。\n\n在实际运行中,为了效率,模型会把好几个用户的请求或者一个长请求的不同部分“打包”在一起处理。但如果这些打包操作没有设计好,即使是同样的输入,由于处理顺序、并行计算中数据共享等细微差别,也可能导致最终结果出现差异\n\n\n解决方案:实现“批次不变性核函数”\n\n为了解决“批次不变性”问题,研究团队提出要对模型中的一些关键操作进行改进:\n\nRMSNorm的批次不变性:RMSNorm就是模型里一种类似的“标准化”操作,确保数据在一个稳定的范围内,让模型更好地学习\n\n在并行计算中,RMSNorm通常会将不同的数据部分分配给不同的计算核心处理。如果设计不当,这些核心之间的通信或数据处理方式的细微差异,就可能导致结果不一致\n\n他们提出了一种数据并行RMSNorm策略。确保每个计算核心只处理一个完整的、独立的任务,这样就避免了不同核心之间为了完成同一个任务而进行复杂的通信,从而保证了每个核心内部的计算是完全独立的和可重复的\n\nAttention的批次不变性:\n\nAttention机制是语言模型里的“聚光灯”,它能让模型在生成每个词的时候,知道应该把注意力放在输入文本的哪些部分上\n\n他们采用了FlashAttention2的并行化策略,在处理查询时进行并行,同时在键和值上进行缩减。所有的缩减操作都可以在一个计算核心内部完成,再次实现了“数据并行”,避免了核心间的通信问题\n\n模型在生成每个词语时,查询的长度会变得非常短。在这种情况下,原来的并行策略可能效率不高。他们采用了一种“固定KV维度切分策略”,也就是将键和值维度进行切分,分配给不同的核心处理,以确保足够的并行度\n\n博客:thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference

阅读全文 :现在这些牛皮研究都不发论文改发博客了?Open AI 前 CTO Mira Murati 的新公司 Thinking Machines 发布重磅研究文章《战胜 LLM 推理中的非确定性》\n\n这篇文章中他们着力于解决从 LLM 几乎无法获得可以复现的结果的问题\n\n\n为什么大型语言模型会出现“非确定性”?\n\n模型的核心部分其实是“确定性”的:研究发现,大型语言模型在处理信息时,最核心的计算步骤本身是“确定性”的\n\n真正的罪魁祸首——“批次不变性”问题:问题出在模型如何同时处理多个请求。\n\n在实际运行中,为了效率,模型会把好几个用户的请求或者一个长请求的不同部分“打包”在一起处理。但如果这些打包操作没有设计好,即使是同样的输入,由于处理顺序、并行计算中数据共享等细微差别,也可能导致最终结果出现差异\n\n\n解决方案:实现“批次不变性核函数”\n\n为了解决“批次不变性”问题,研究团队提出要对模型中的一些关键操作进行改进:\n\nRMSNorm的批次不变性:RMSNorm就是模型里一种类似的“标准化”操作,确保数据在一个稳定的范围内,让模型更好地学习\n\n在并行计算中,RMSNorm通常会将不同的数据部分分配给不同的计算核心处理。如果设计不当,这些核心之间的通信或数据处理方式的细微差异,就可能导致结果不一致\n\n他们提出了一种数据并行RMSNorm策略。确保每个计算核心只处理一个完整的、独立的任务,这样就避免了不同核心之间为了完成同一个任务而进行复杂的通信,从而保证了每个核心内部的计算是完全独立的和可重复的\n\nAttention的批次不变性:\n\nAttention机制是语言模型里的“聚光灯”,它能让模型在生成每个词的时候,知道应该把注意力放在输入文本的哪些部分上\n\n他们采用了FlashAttention2的并行化策略,在处理查询时进行并行,同时在键和值上进行缩减。所有的缩减操作都可以在一个计算核心内部完成,再次实现了“数据并行”,避免了核心间的通信问题\n\n模型在生成每个词语时,查询的长度会变得非常短。在这种情况下,原来的并行策略可能效率不高。他们采用了一种“固定KV维度切分策略”,也就是将键和值维度进行切分,分配给不同的核心处理,以确保足够的并行度\n\n博客:thinkingmachines.ai/blog/defeating-nondeterminism-in-llm-inference

Seedream 4.0 图片模型 4K 直出质量太顶了

我去,太吊了。 试了一下豆包 Seedream 4.0 的 4K 直出模式,文字和合成进去的图片极其清晰,一点劣化没有。 第一张这个日记除了最后俩字,看起来就像我自己拿设计软件做的也一样。 自媒体知识卡片更是根本看不出是 AI 生成,文字非常细腻清晰,这下真神器了。 目前只有火山的 API 是可以直出 4K 的

阅读全文 :Seedream 4.0 图片模型 4K 直出质量太顶了

教你用Seedream 4把鼠标垫变护身符

哈哈 Seedream 4 生成图片的融合度太顶了,我把自己的鼠标垫变成许愿符风格了。 提示词:请将图片中涂抹的区域,替换成一个全新的、超写实风格的布艺鼠标垫。 鼠标垫设计要求: 设计主题: 鼠标垫的整个表面,需要完美地印刷上一个国潮护身符票据的图案。 图案细节: 这个票据图案以复古米黄为底色,外圈有复杂的绿色花纹边…

阅读全文 :教你用Seedream 4把鼠标垫变护身符

藏师傅教你用即梦(SeedDream)4给自己画很有质感的头像

用即梦 (Seed dream) 4 图像模型给自己做一个非常有质感的头像。 这还原的也太好了,关键的 ID 要素都还原了,而且有那种非常有质感的笔触效果。 也可以给你喜欢的游戏或者动漫角色画,当然也可以搞抽象,给味真族族长大胃袋画一个。 提示词:参考图1的风格和样式为图2的角色生成一个图标,同时只要参考图2的头部位…

阅读全文 :藏师傅教你用即梦(SeedDream)4给自己画很有质感的头像

Kimi K2 模型升级,藏师傅一手测试!

月之暗面更新了 K2 模型的 0905 版本,我试了一下,这次 Coding 能力提升挺大。 尤其 3D 房屋展示那个案例比我前几天用 Claude 4.1 写的时候轻松好多。 从公告来看这次升级将上下文提升到了 256K,在编码 Agent 下 Coding 能力也有所提升,前端代码美观度有所提升。 我拿之前测试…

阅读全文 :Kimi K2 模型升级,藏师傅一手测试!

快手开源可本地部署的视频理解模型!

快手在视频上的布局越来越全面了啊,这几天开源了 Kwai Keye-VL-1.5-8B 模型。 除了支持图像识别以外,视频理解能力也很强,加上 8B 的大小非常适合本地部署用来做视频标注和内容识别。 我试了一下,给了一个是描述视频画面内容以及查找分镜时间和每个分镜的内容描述都做的不错。 模型主要优势有: 短视频理解:…

阅读全文 :快手开源可本地部署的视频理解模型!

美团开源顶尖 LLM,能力强、推力快、成本低

海外对美团开源的这个模型 LongCat-Flash 评价不错啊,刷到好几个介绍贴了。 基准测试与 DeepSeek-V3、Qwen3 等差不多,同时推理速度非常快,比DeepSeek-V3 快了至少一倍,在千亿参数量下,还能用低成本实现100 tokens/秒的推理速度,非常经济了可以说。 仔细看了一下论文和介绍记…

阅读全文 :美团开源顶尖 LLM,能力强、推力快、成本低

最火的两大Nano Banana玩法叠加!

既然转手办很火、动漫转真人也很火,那动漫图转真人Cosplay 展示手办呢? 哈哈,优化了一下下午 Nano Banana 转手办的玩法,现在变成真人Coser在桌前展示自己刚打的手办。 其他装备类展示也可以这么玩,比如你展示自己的自行车手办。 提示词: Generate a real-life photo of a…

阅读全文 :最火的两大Nano Banana玩法叠加!

Nano Banana 手办又出了打印机版本?

好像现在Nano Banana手办又多了一个背后是 3D打印机的版本? 用我的汽车订单截图转了几张,确实看起来比Blender应景一些,而且还会出现正在打印的半成品效果更真实了。 直接拿我订单截图转的 哈哈 配置都跟我选的一样。 提示词,注意关于汽车和品牌的词自己用的时候需要更换: Please transform…

阅读全文 :Nano Banana 手办又出了打印机版本?

藏师傅教你用Nano Banana解答世间万物

大聪明(赛博禅心)刚才发了个 Nano Banana 一图读懂XXX的提示词。 非常适合用来学习和解释一些概念,浅显易懂。 但他那个是针对 Lovart 搞的,我优化了一下,现在单独用Nano Banana也可以稳定生成,而且排版更加一致。 这么好的点子怎么能不做个产品呢? 来了朋友们,Nano Banana 解答世…

阅读全文 :藏师傅教你用Nano Banana解答世间万物