歸
公众号

歸藏的AI工具箱

产品设计师AI画图工具操作员AI课程撰写与信息收集整理致力于发掘借助AI工具改善

790 篇已收录文章

这个来源的文章

按发布时间排序

Skywork桌面版:Windows也有Cowork用了!

昆仑天工 Skywork 居然也推出了类似 Cowork 的桌面版版本,而且还有很多人很需要的Windows版本,这个太好了! 并且读取之后帮你基于文件内容生成新的内容,这个非常符合大部分职场白领的工作状态。无论是图片、文档还是表格和PPT都可以被理解拆分重新生成新的内容。 另外跟 Anthropic 的 Cowor…

阅读全文 :Skywork桌面版:Windows也有Cowork用了!

Claude Code 的创建者 Boris 再次分享,\nAnthropic 内部总结的 Claude Code 使用技巧。\n\n简短而清晰,很多技巧都非常有用,强烈推荐看看:\n\n1️⃣ 同时开 3-5 个 git worktree,每个跑一个独立的 Claude 会话。这是团队公认的最大生产力提升点。\nBoris 自己用多个 git checkout,但团队大多数人更喜欢 worktree。\n\n2️⃣每个复杂任务都从plan mode开始。比如让一个 Claude 写计划,然后启动第二个 Claude 以幕僚工程师的身份审查。或者一旦事情跑偏,立刻切回计划模式重新规划。还会明确要求 Claude 在验证步骤进入计划模式。\n\n3️⃣每次纠正错误后,都以这句话结尾:"更新你的 CLAUDE. md,确保不再犯同样的错误。毫不留情地不断迭代直到 Claude 的错误率明显下降。\n\n4️⃣创建自己的 Skills 并提交到 git,在每个项目中复用。如果你每天做某件事超过一次,就把它变成Skills。\n\n5️⃣大部分 bug Claude 都能自己修。启用 Slack MCP,把 Slack 里的 bug 讨论帖粘贴给 Claude,只说一句"修复它"。或者直接说"去修复失败的 CI 测试",不要微观管理怎么做\n\n6️⃣提升提示词水平。说"针对这些改动严厉审查我,在我通过测试之前不要创建 PR"。让 Claude 当你的审查员。或者说"向我证明这行得通",让 Claude 对比 main 分支和功能分支的行为差异\n\n7️⃣在平庸的修复后,说:"基于你现在掌握的所有信息,废弃这个方案,实现那个更优雅的解决方案。交付任务前,写详细的规格说明,减少歧义。描述得越具体,输出越好\n\n8️⃣团队很喜欢 Ghostty 终端。有同步渲染、24 位色彩和完善的 Unicode 支持。用 /statusline 自定义状态栏,始终显示上下文使用情况和当前 git 分支。给终端标签页做颜色编码和命名,每个任务或 worktree 一个标签页。\n\n9️⃣用语音听写。你说话比打字快 3 倍,提示词会变得详细得多。macOS 上连按两次 fn 键就能开启\n\n🔟在任何希望 Claude 投入更多算力的请求中,加上"use subagents"。把单个任务分给子代理,保持主代理的上下文窗口整洁专注\n\n让 Claude Code 用 "bq" CLI 即时提取和分析指标\n\n用 Claude 学习在 /config 里启用"解释型"或"学习型"输出风格,让 Claude 解释它改动背后的"原因"\n\n详情:x.com/bcherny/status/2017742741636321619\n第一次分享的内容在这里:Claude Code 的创建者 Bor...

阅读全文 :Claude Code 的创建者 Boris 再次分享,\nAnthropic 内部总结的 Claude Code 使用技巧。\n\n简短而清晰,很多技巧都非常有用,强烈推荐看看:\n\n1️⃣ 同时开 3-5 个 git worktree,每个跑一个独立的 Claude 会话。这是团队公认的最大生产力提升点。\nBoris 自己用多个 git checkout,但团队大多数人更喜欢 worktree。\n\n2️⃣每个复杂任务都从plan mode开始。比如让一个 Claude 写计划,然后启动第二个 Claude 以幕僚工程师的身份审查。或者一旦事情跑偏,立刻切回计划模式重新规划。还会明确要求 Claude 在验证步骤进入计划模式。\n\n3️⃣每次纠正错误后,都以这句话结尾:"更新你的 CLAUDE. md,确保不再犯同样的错误。毫不留情地不断迭代直到 Claude 的错误率明显下降。\n\n4️⃣创建自己的 Skills 并提交到 git,在每个项目中复用。如果你每天做某件事超过一次,就把它变成Skills。\n\n5️⃣大部分 bug Claude 都能自己修。启用 Slack MCP,把 Slack 里的 bug 讨论帖粘贴给 Claude,只说一句"修复它"。或者直接说"去修复失败的 CI 测试",不要微观管理怎么做\n\n6️⃣提升提示词水平。说"针对这些改动严厉审查我,在我通过测试之前不要创建 PR"。让 Claude 当你的审查员。或者说"向我证明这行得通",让 Claude 对比 main 分支和功能分支的行为差异\n\n7️⃣在平庸的修复后,说:"基于你现在掌握的所有信息,废弃这个方案,实现那个更优雅的解决方案。交付任务前,写详细的规格说明,减少歧义。描述得越具体,输出越好\n\n8️⃣团队很喜欢 Ghostty 终端。有同步渲染、24 位色彩和完善的 Unicode 支持。用 /statusline 自定义状态栏,始终显示上下文使用情况和当前 git 分支。给终端标签页做颜色编码和命名,每个任务或 worktree 一个标签页。\n\n9️⃣用语音听写。你说话比打字快 3 倍,提示词会变得详细得多。macOS 上连按两次 fn 键就能开启\n\n🔟在任何希望 Claude 投入更多算力的请求中,加上"use subagents"。把单个任务分给子代理,保持主代理的上下文窗口整洁专注\n\n让 Claude Code 用 "bq" CLI 即时提取和分析指标\n\n用 Claude 学习在 /config 里启用"解释型"或"学习型"输出风格,让 Claude 解释它改动背后的"原因"\n\n详情:x.com/bcherny/status/2017742741636321619\n第一次分享的内容在这里:Claude Code 的创建者 Bor...

介绍一下我昨天开源这个视频特效包装 Skills 的工作原理:\n\nSkills 的主要功能是分析你的视频和字幕,然后为你的视频自动添加各类常见的视频包装效果,比如:进度条、花字、介绍卡片等。\n\n原理简单来说这个 Skills 先用字幕智能分析生成特效配置,再由浏览器渲染逐帧生成特效图层。\n最后通过视频合成把这些特效包装图层叠加到原始视频上的。\n\n------\n\n输入「视频 + 字幕」,先用 `content_analyzer.py` 从 SRT 里识别人物、章节、金句、术语、数据等,生成各种 Suggestion;\n\n用户确认后写成统一的 `config.json` 配置,再交给渲染和合成管线。\n\n`video_processor.py` 是主入口,负责解析命令行和配置、选择渲染后端(Browser 或 PIL)、按时间段分发不同组件的渲染任务。\n\n主要渲染器 Browser 后端用 Playwright 打开 HTML 模板 + CSS 主题 + Anime.js 动画,通过 `initAnimation(config)` 初始化、`seek(timeMs)` 驱动逐帧截图输出 PNG\n\n`templates/*.html` 定义 9 类组件,通过约定的 JS API 接收配置和时间;\n`static/css/theme-*.css` 定义 notion/cyberpunk/apple/aurora 等主题,用 CSS 变量 + `data-theme` 切换风格。\n\n新增组件只需:加一个 HTML 模板、在 `BrowserRenderer` 里加渲染方法,在 `video_processor.py` 注册处理逻辑、在 `content_analyzer.py` 增加对应 Suggestion 和配置校验;\n\n新增主题则是新增一份 theme CSS 并在模板中引用。\n\n项目地址:github.com/op7418/Video-Wrapper-Skills

阅读全文 :介绍一下我昨天开源这个视频特效包装 Skills 的工作原理:\n\nSkills 的主要功能是分析你的视频和字幕,然后为你的视频自动添加各类常见的视频包装效果,比如:进度条、花字、介绍卡片等。\n\n原理简单来说这个 Skills 先用字幕智能分析生成特效配置,再由浏览器渲染逐帧生成特效图层。\n最后通过视频合成把这些特效包装图层叠加到原始视频上的。\n\n------\n\n输入「视频 + 字幕」,先用 `content_analyzer.py` 从 SRT 里识别人物、章节、金句、术语、数据等,生成各种 Suggestion;\n\n用户确认后写成统一的 `config.json` 配置,再交给渲染和合成管线。\n\n`video_processor.py` 是主入口,负责解析命令行和配置、选择渲染后端(Browser 或 PIL)、按时间段分发不同组件的渲染任务。\n\n主要渲染器 Browser 后端用 Playwright 打开 HTML 模板 + CSS 主题 + Anime.js 动画,通过 `initAnimation(config)` 初始化、`seek(timeMs)` 驱动逐帧截图输出 PNG\n\n`templates/*.html` 定义 9 类组件,通过约定的 JS API 接收配置和时间;\n`static/css/theme-*.css` 定义 notion/cyberpunk/apple/aurora 等主题,用 CSS 变量 + `data-theme` 切换风格。\n\n新增组件只需:加一个 HTML 模板、在 `BrowserRenderer` 里加渲染方法,在 `video_processor.py` 注册处理逻辑、在 `content_analyzer.py` 增加对应 Suggestion 和配置校验;\n\n新增主题则是新增一份 theme CSS 并在模板中引用。\n\n项目地址:github.com/op7418/Video-Wrapper-Skills

MiniMaxAgent居然有类似Cowork的本地端了!

MiniMax 居然也发布了一个类似 Cowaork 的本地Agent。 就是他们原来MiniMax Agent的本地客户端。 它现在支持调用你的本地数据,分析处理本地的文档、视频并整理文件。还可以自动地调用本地浏览器查找网页内容。 另外针对一些常见的本地任务,他们也封装了很多专家agents:文件整理、深度研究,还…

阅读全文 :MiniMaxAgent居然有类似Cowork的本地端了!

藏师再做自媒体神器!解决视频包装难题

妈的,藏师傅又做了一个自媒体神器! 我可能要彻底解决视频包装问题了! 视频包装 Video Wrapper Skills,给视频自动添加各种动画特效! - 一键完成任何视频的包装特效添加; - 自动分析内容,给出特效添加建议; - 内置四套样式主题,Notion、Cyberpunk 等; - 提供十多个特效组件,花字…

阅读全文 :藏师再做自媒体神器!解决视频包装难题

DeepSeek 这还没到过年就开始发力了!\n\n发布了升级后的 OCR 2 模型,主要优化是加入模拟人类视觉的“因果推理”机制。\n\n将原来的 Clip 模型替换为 LLM 架构模型,用的 Qwen 0.5B。\n\n看看这两代模型都做了什么👇\n\n------\n\n从视觉压缩到因果推理\n\nOCR 1 证明了一件事:视觉可以作为文本的高效压缩形式。\n\n"一张图胜过千言万语"不只是比喻。他们的实验显示,10 个文本 token 压缩成 1 个视觉 token 时,OCR 精度能达到 97%。甚至 20 倍压缩比下还能保留 60% 的精度。\n\n这解决了 LLM 处理长文本计算量大的问题,用视觉模态节省 Token。\n\n------\n\nOCR 2 要解决的是更本质的问题:阅读顺序。\n\n传统的 Vision Encoder 都是固定的光栅扫描,从左到右,从上到下。但人类看图不是这样的,你会根据内容的语义逻辑跳着看。\n\n复杂排版的文档、表格、公式,空间位置顺序和逻辑阅读顺序根本不一样。OCR 2 就是要让编码器学会这种"因果推理"能力。\n\n======\n\n架构升级:用 LLM 替换 CLIP\n\nOCR 1 的编码器是 SAM + CLIP 串联结构。SAM 负责视觉感知(窗口注意力),CLIP 负责视觉知识(全局注意力)。\n\nOCR 2 把 CLIP 换成了一个紧凑的 LLM(Qwen2 0.5B)。\n\n为什么要这么做?因为 LLM 架构天然具备"因果推理能力"\n\n------\n\n注意力机制的巧妙设计\n\nOCR 2 用了混合注意力机制:\n\n▸ 视觉 Token 之间:双向注意力(类似 ViT),保持全局视野\n▸ 新增的查询 Token(Query):因果注意力(类似 LLM 解码器)\n\n这些 Query 的数量和视觉 Token 一样多,它们的作用是对视觉信息进行语义重排序\n\n通过定制的注意力掩码,Query 采用三角形掩码,能基于之前的上下文逐步"推理"出下一个视觉信息的重点\n\n======\n\n级联因果推理:两步走\n\nOCR 2 的推理过程是级联的:\n\n第一步,编码器通过 Causal Query 对视觉信息进行逻辑重排序。\n第二步,解码器(DeepSeek-3B-MoE)再进行文本生成\n\n这种设计显著提升了文档的阅读顺序准确性。在 OmniDocBench 测试中,阅读顺序编辑距离从 0.085 降到 0.057\n\n======\n\nOCR 2 继承了 OCR 1 的高压缩特性\n\n视觉 Token 数量限制在 256 到 1120 之间,既保证效率,又通过因果重排序提升了信息密度\n在相同或更少的 Token 预算下,OCR 2 在 OmniDocBench 上的整体性能比 OCR 1 提升了 3.73%\n\n详情:huggingface.co/deepseek-ai/DeepSeek-OCR-2

阅读全文 :DeepSeek 这还没到过年就开始发力了!\n\n发布了升级后的 OCR 2 模型,主要优化是加入模拟人类视觉的“因果推理”机制。\n\n将原来的 Clip 模型替换为 LLM 架构模型,用的 Qwen 0.5B。\n\n看看这两代模型都做了什么👇\n\n------\n\n从视觉压缩到因果推理\n\nOCR 1 证明了一件事:视觉可以作为文本的高效压缩形式。\n\n"一张图胜过千言万语"不只是比喻。他们的实验显示,10 个文本 token 压缩成 1 个视觉 token 时,OCR 精度能达到 97%。甚至 20 倍压缩比下还能保留 60% 的精度。\n\n这解决了 LLM 处理长文本计算量大的问题,用视觉模态节省 Token。\n\n------\n\nOCR 2 要解决的是更本质的问题:阅读顺序。\n\n传统的 Vision Encoder 都是固定的光栅扫描,从左到右,从上到下。但人类看图不是这样的,你会根据内容的语义逻辑跳着看。\n\n复杂排版的文档、表格、公式,空间位置顺序和逻辑阅读顺序根本不一样。OCR 2 就是要让编码器学会这种"因果推理"能力。\n\n======\n\n架构升级:用 LLM 替换 CLIP\n\nOCR 1 的编码器是 SAM + CLIP 串联结构。SAM 负责视觉感知(窗口注意力),CLIP 负责视觉知识(全局注意力)。\n\nOCR 2 把 CLIP 换成了一个紧凑的 LLM(Qwen2 0.5B)。\n\n为什么要这么做?因为 LLM 架构天然具备"因果推理能力"\n\n------\n\n注意力机制的巧妙设计\n\nOCR 2 用了混合注意力机制:\n\n▸ 视觉 Token 之间:双向注意力(类似 ViT),保持全局视野\n▸ 新增的查询 Token(Query):因果注意力(类似 LLM 解码器)\n\n这些 Query 的数量和视觉 Token 一样多,它们的作用是对视觉信息进行语义重排序\n\n通过定制的注意力掩码,Query 采用三角形掩码,能基于之前的上下文逐步"推理"出下一个视觉信息的重点\n\n======\n\n级联因果推理:两步走\n\nOCR 2 的推理过程是级联的:\n\n第一步,编码器通过 Causal Query 对视觉信息进行逻辑重排序。\n第二步,解码器(DeepSeek-3B-MoE)再进行文本生成\n\n这种设计显著提升了文档的阅读顺序准确性。在 OmniDocBench 测试中,阅读顺序编辑距离从 0.085 降到 0.057\n\n======\n\nOCR 2 继承了 OCR 1 的高压缩特性\n\n视觉 Token 数量限制在 256 到 1120 之间,既保证效率,又通过因果重排序提升了信息密度\n在相同或更少的 Token 预算下,OCR 2 在 OmniDocBench 上的整体性能比 OCR 1 提升了 3.73%\n\n详情:huggingface.co/deepseek-ai/DeepSeek-OCR-2

牛皮了!Youtube 视频一键长剪短&翻译 Skills

搞了一个牛皮 Skills ! 从任何 Youtube 视频链接剪辑为带有双语字幕的短视频和发布文案! 一键完成火爆 Youtube 视频的拆解和发布。 - 自动下载视频和原始字幕 - 自动分析总结字幕并对视频进行分段 - 选择需要剪辑的具体分段 - 翻译已选分段对应多语言字幕 - 将双语字幕烧录进已剪辑视频 - 生…

阅读全文 :牛皮了!Youtube 视频一键长剪短&翻译 Skills

推特官方教你产出爆款文章!\n\n尤其是认证用户必须看,这可都是钱啊朋友们!\n\n推特算法最近对于长文的推荐非常高,还增加了创作者分成。\n\n这些技巧其实对于其他平台也实用如果你也经常写文章,推荐看看。\n\n------\n\n一、 核心写作技巧:如何写出好文章\n\n明确写作目的:\n动笔前先问自己,希望读者读完后有什么想法、感受或行动?这篇文章究竟是写给谁看的?\n\n打造“钩子”标题与开头:\n标题必须具体、激发好奇心并承诺提供价值。开头用强有力的第一句话吸引读者,并配合一张视觉吸引力强且相关的头图。\n\n结构优化:为“扫读”而生:\n段落要短(最多 2-4 行)。每 3-5 个段落插入一个小标题。多用列表(Bullet points)代替大段文字。加粗关键洞察,确保每一段只传达一个核心观点。\n\n建立自然、独特的语调:\n像对好朋友说话一样写作,使用“你”、“你的”等对话式语言,避免过于专业的“讲课感”\n\n用事实支撑观点:\n观点之后紧跟证据:数据、个人故事、前后对比图等。可以嵌入 X 帖子或其他文章作为生动的例证。\n\n无情的编辑:\n初稿是写给自己的,二稿才是写给读者的。写完后至少删减 20-30% 的字数。删掉废话(如 "very", "really", "in order to"),并大声朗读全文以发现不通顺的句子。\n\n加入视觉元素:\n利用图片、截图、图表或嵌入的帖子来打破纯文本的单调,提高文章的可分享性。\n\n强有力的结尾:\n不要草草收尾。总结要点,提出问题引发回复,或鼓励读者立即尝试某个建议。\n\n------\n\n二、 传播与增长:如何扩大影响力\n\n发布前预热: 提前几小时发布预告或相关问题,制造期待感。\n\n置顶文章: 新文章发布后的 24-72 小时内将其置顶,最大化被发现的概率。\n\n拆解为推文串(Thread): 摘取文章的精彩片段发成 Thread,并链接回全文。\n\n回复早期评论: 积极回复第一波读者的评论,这能提升可见度并从算法上信号这一内容的受欢迎程度。\n\n旧文重发: 当相关新闻热点出现时,重新分享相关的常青树旧文。\n\n来源:x.com/XCreators/status/2011957172821737574

阅读全文 :推特官方教你产出爆款文章!\n\n尤其是认证用户必须看,这可都是钱啊朋友们!\n\n推特算法最近对于长文的推荐非常高,还增加了创作者分成。\n\n这些技巧其实对于其他平台也实用如果你也经常写文章,推荐看看。\n\n------\n\n一、 核心写作技巧:如何写出好文章\n\n明确写作目的:\n动笔前先问自己,希望读者读完后有什么想法、感受或行动?这篇文章究竟是写给谁看的?\n\n打造“钩子”标题与开头:\n标题必须具体、激发好奇心并承诺提供价值。开头用强有力的第一句话吸引读者,并配合一张视觉吸引力强且相关的头图。\n\n结构优化:为“扫读”而生:\n段落要短(最多 2-4 行)。每 3-5 个段落插入一个小标题。多用列表(Bullet points)代替大段文字。加粗关键洞察,确保每一段只传达一个核心观点。\n\n建立自然、独特的语调:\n像对好朋友说话一样写作,使用“你”、“你的”等对话式语言,避免过于专业的“讲课感”\n\n用事实支撑观点:\n观点之后紧跟证据:数据、个人故事、前后对比图等。可以嵌入 X 帖子或其他文章作为生动的例证。\n\n无情的编辑:\n初稿是写给自己的,二稿才是写给读者的。写完后至少删减 20-30% 的字数。删掉废话(如 "very", "really", "in order to"),并大声朗读全文以发现不通顺的句子。\n\n加入视觉元素:\n利用图片、截图、图表或嵌入的帖子来打破纯文本的单调,提高文章的可分享性。\n\n强有力的结尾:\n不要草草收尾。总结要点,提出问题引发回复,或鼓励读者立即尝试某个建议。\n\n------\n\n二、 传播与增长:如何扩大影响力\n\n发布前预热: 提前几小时发布预告或相关问题,制造期待感。\n\n置顶文章: 新文章发布后的 24-72 小时内将其置顶,最大化被发现的概率。\n\n拆解为推文串(Thread): 摘取文章的精彩片段发成 Thread,并链接回全文。\n\n回复早期评论: 积极回复第一波读者的评论,这能提升可见度并从算法上信号这一内容的受欢迎程度。\n\n旧文重发: 当相关新闻热点出现时,重新分享相关的常青树旧文。\n\n来源:x.com/XCreators/status/2011957172821737574

Claude Code 发布了两个不错的更新

Claude Code 发布了两个不错的更新 MCP 工具搜索以及接受或者拒绝提示的时候 Tab 键补充信息 MCP 工具搜索这个很好,以前如果你在 Claude Code 里面安装了大量 MCP ,在检索工具的时候就会占用你大量的上下文。 MCP 工具搜索加入之后,工具会动态地加载到上下文里面。 如果你有一个 MC…

阅读全文 :Claude Code 发布了两个不错的更新

PixVerse首发R1实时世界模型:藏师傅实测

前几天测试的 Pixverse R1 终于发布了,这是一个可以实时生成并且可以随时通过提示词介入修改后续内容的世界模型。 极限情况下可以实时生成 1080P 的高清视频,感觉成本再下来一点以后 AI 游戏和交互式的影视内容有戏了啊。 简单介绍一下使用体验,目前他们在一个单独的平台测试需要邀请码。 你可以选择预制的的三…

阅读全文 :PixVerse首发R1实时世界模型:藏师傅实测