PostgreSQL码农集散地

本周 Github 热门榜单

本周周榜 17 个项目里, 真正值得展开的只有 3 个。 Hindsight 一周涨了 17,403 stars, 底层就是 PostgreSQL + pgvector, 而且把混合召回的四路并行写进了 README; Paperclip 涨 14,335 stars, 干的事是把一堆 Agent 塞进组织架构里当员工管; google/ax 涨 2,919 stars, Google 官方出手把 Agent 定义成一种新的工作负载。

三个项目分属三层, 放一起读才看得出 2026 年 9 月开源生态在忙什么:

记忆层 → 组织层 → 运行时层

单看任何一个都成立, 但连起来是一条清晰的路线: Agent 已经不满足于"能跑通 demo", 它需要记忆系统来持有长期上下文, 需要组织系统来管理"谁干什么、花多少钱", 需要调度系统来当成一种生产负载来跑。

对 DBA 来说, Hindsight 那个 "PostgreSQL + pgvector, 一套 4 路并行召回" 的组合值得单独讲一次。对 AI 实践者来说, Paperclip 的预算/审批/审计三件套是可复制的方法论。


① Hindsight — 会学习的 Agent 记忆底座

仓库: vectorize-io/hindsight · 主语言: Python · 本周 +17,403 stars · 总星 44,498 · License: MIT · 创建于 2025-10-30 · topics: agentic-ai / agents / ai-memory / memory

为什么一周涨 1.7 万星

现在的 Agent 记忆项目大多在做一个动作: 把对话里的要点抽出来, 塞进向量库, 下次提问时 top-k 捞几条拼进 prompt。Hindsight 的定位不一样 —— 它不满足于"记得", 它要做"学会"。

README 第一句写得很直接: 大多数 Agent 记忆系统只关注回忆对话历史, Hindsight 关注的是让 Agent 学习而不只是记住。

这个项目不是小作坊做的。论文发在 arXiv(2512.12818, 2025-12-14), README 里说 LongMemEval 的成绩被 Virginia Tech 的 Sanghani Center 和 The Washington Post 独立复现过, 其他对比分数是厂商自报 —— 这句话本身就是个可信度信号, 敢于标出哪些数字是别人验的, 比全是自报要可信。

三个操作, 不是一层检索

整个系统只暴露三个动作, 但每个动作内部做的事比看起来多。

retain(存) : 调用 LLM 抽取关键事实、时间信息、实体和关系, 再经过归一化, 转成规范实体、时间序列和检索索引。这步不是简单存原文, 是先把非结构化内容压成可检索的结构。

recall(取) : 这是最值得 DBA 看的一段。它同时跑 4 路检索:

  • 语义路 —— 向量相似度
  • 关键词路 —— BM25 精确匹配
  • 图谱路 —— 实体 / 时间 / 因果关系链接
  • 时间路 —— 时间区间过滤

4 路结果并行跑完, 用 RRF(倒数排名融合) 合并排序, 再过一道 cross-encoder 重排, 最后按 token 预算裁剪。

这个组合不是新东西, 但值得注意的是它把 4 路做成了默认行为而不是可选项。很多团队做混合召回时的问题是"向量 + BM25 两路就够了吧", 真正难调的是权重; RRF 的价值恰好在于不用手调权重 —— 只按名次加权。

reflect(思) : 在已有记忆上做深度分析, 建立新连接, 回答需要推理而不是查表的问题。比如销售 Agent 分析"为什么有的外联消息有回复有的没有"。

记忆的 4 种类型

它把记忆分成 4 层, 这个分类比大多数记忆系统细:

  • 世界事实("炉子很烫")
  • Agent 经验("我摸了炉子, 真的很疼")
  • 观察(observations) —— 由大量记忆归纳出的、带证据支撑的信念, 且带原文引用和证据计数
  • 心智模型(mental models) —— 对一个 bank 的常驻问题的答案, 后台持续改写

observations 那段有个细节值得记: 新证据到来时是精修已有信念, 不是静默覆盖。信念会因此被加强、削弱或扩展。这是"记忆系统"和"日志系统"的根本区别。

还有两个工程细节: 心智模型读取是一次数据库读, 不触发检索也不调 LLM —— Agent 可以带着一页已经沉淀好的知识启动, 而不是每个 session 重新发现一遍。多语言是端到端的, "张伟"不会被转成 "Zhang Wei"。

底层是什么

PostgreSQL + pgvector 是默认存储, 也支持 Oracle AI Database 23ai(功能对等)。部署方式三种: 嵌入式 pg0(免服务器, pip install hindsight-all)、外部 PostgreSQL、Helm 到 K8s。配置是分层的: 全局环境变量 → 单租户 → 单 bank。

每个 bank 是一个隔离的"大脑", 严格隔离, 无跨 bank 泄漏。还有个可选的 Memory Defense 策略, 按 45 个模式扫每条 retain, 命中就脱敏成 [REDACTED:github_token] 或直接拦下。

对你的价值

  • 数据库生态方向(直接命中) : 这是本周唯一一个把 pgvector 当默认底座、还愿意把 4 路召回写清楚的开源 Agent 记忆项目。PG 库上做 RAG 基础设施, 过去要自己拼, 现在有现成参考实现。
  • AI 记忆/混合召回方向(直接命中) : RRF + cross-encoder 的组合、observations 的证据计数机制、mental model 的"读一次不调 LLM", 这三点都可以直接搬到自己项目里。
  • 边界: README 里的 benchmark 数字是厂商自报, 我没跑过。长 MemEval 39% → 83.6% 的对比对象是同 backbone 的全上下文基线, 换句话说它证明的是"记忆比塞满上下文强", 不是"这套实现比别家强"。

Image
Hindsight — 会学习的 Agent 记忆底座

② Paperclip — 给 Agent 团队装一套组织架构

仓库: paperclipai/paperclip · 主语言: TypeScript · 本周 +14,335 stars · 总星 96,040 · License: MIT · 创建于 2026-03-02

它的比喻

README 里有句话很抓人: 如果 OpenClaw 是员工, Paperclip 就是公司。

它长得像任务管理器(kanban、审批、线程), 底下跑的是组织架构: 目标、部门、汇报线、预算、权限。

这个项目 3 月才建仓, 到 10 月 2 日已经 96,040 stars、16,276 forks。fork/star 比例约 17%, 明显高于同榜其他项目 —— 大多数是 2-3%。这个比例通常意味着"一堆人拿去改", 是项目被大量二次开发的信号, 但具体成因我没核实。

接入方式: 能收心跳就是员工

它不绑定任何一家 agent runtime。只要能接收心跳, 就能被"雇佣"。README 列出的: OpenClaw、Claude Code、Codex、Cursor / Cursor Cloud、Gemini CLI、OpenCode、Pi、Grok Build、Kimi Code, 以及 Hermes + Gateway。

每个 Agent 独立选模型和 harness, 但任务、技能、权限、历史集中在一处。

四根支柱

支柱
覆盖什么
Agentic Task Manager
任务、审批门、可审计的例行流程。从 diff、截图、测试验收产出
Agent 组织架构
人机混合组织图、汇报线、授权边界、谁能做什么的治理规则、密钥按公司边界隔离
Agent 员工培训
Skill Studio 全组织共享、evals 与测试留档、主动学习循环 + 质量指标、技能版本历史与回滚
Agentic OS
跨厂商运行时、沙箱、MCP、SSO/RBAC、成本管控与阈值告警、运行历史 + 可选 tracing

第二根支柱里的"混合组织图"和"授权边界"是普通项目管理工具里没有的概念 —— 你的下属里有人, 也有 Agent, 而 Agent 的权限需要单独管。

第四根支柱的成本管控做得很细: 公司 / 项目 / Agent 三级预算, 记录上报花费, 阈值告警, 到限额直接暂停工作。

对你的价值

  • AI 应用实践方向(直接命中) : 最值钱的是"Skill 版本历史 + 回滚"和"evals 测试留档"。主人的 skill 库现在越攒越多, 改坏了要能退回去 —— Paperclip 把这件事做成了产品内置能力, 值得抄这个设计。
  • 可直接借鉴的三件套: ① 三级预算 + 阈值暂停(主人的多 cron 就有"撞点"和成本问题); ② 审批门(关键 cron 产出走人工确认); ③ 心跳接入(任何能定时触发的进程都能当 Agent 挂进去)。
  • 边界: 它是"管理面", 不是"执行面"。Agent 到底跑得好不好, 还得看它挂的那个 agent runtime。

Image
Paperclip — 给 Agent 团队装一套组织架构

③ google/ax — Agent 也是一种工作负载

仓库: google/ax · 主语言: Go · 本周 +2,919 stars · 总星 12,824 · License: Apache-2.0 · 创建于 2026-03-30 · 最近 push 2026-09-27

出发点

README 里这段话说得很准:

Agents are a new kind of workload. They are neither stateless microservices nor run-to-completion batch jobs. They accumulate state, need strict isolation, call out to model APIs and tool servers, and can burn money in a loop if nobody is watching.

翻译过来: Agent 既不是无状态微服务, 也不是跑完就结束的批处理。它积累状态, 需要严格隔离, 会调模型 API 和工具服务, 而且没人盯着的时候会在一个循环里烧钱。

这几条正好对应了现有编排方案的四类不足。所以 Google 的解法是 —— 别用 K8s 现有的抽象硬套, 也不要用 cron + shell 那套, 直接给 Agent 一套自己的资源模型, 但操作习惯保持 kubectl 那样熟。

三个原语

apiVersion:ax.io/v1alpha1
kind:Workspace
metadata:
name:golang
spec:
git:
-repo:https://github.com/golang/go.git
branch:"my-fix"

Workspace —— 预接 Git 仓库、MCP Server 和技能包, Agent 起来就是热的, 不用每次冷启动现拉。

Task —— 沙箱 actor, 跑在 Agent Substrate 上, 有 CPU/内存配额和严格隔离。设了 spec.debug: true 就能 ax ssh 进去看它到底在干嘛。

Model —— 平台自己调哪个 LLM, 凭据从 Kubernetes Secret 读, 不写进 YAML 明文。

生命周期这条最关键

ax suspend 存盘 actor 状态后暂停, ax resume 从原地继续。

这是它跟其他编排器拉开差距的地方。大部分编排器把 Agent 当"一个要重跑的任务", Agent 一挂就得从头再来。而 Agent 跑长任务时挂掉是常态, 能存盘能续跑, 才谈得上"无人监督跑 24 小时"。

命令也是 kubectl 那一套: apply / get / describe / watch / delete, 外加 suspend / resume / ssh / ctx / tunnel。切集群跟 kubectx 联动。

对你的价值

  • AI 应用实践方向(直接命中) : "Agent 是一种新工作负载"这个判断是对的, 而且它给了一个可运行的答案。你现在的多 cron + 多子任务编排, 缺的正是 suspend/resume 这种断点续跑能力 —— 一个跑两小时的深度调研任务中途失败, 现在只能从头再来。
  • 架构参考价值: Workspace 预热这个设计很实用, 等价于给每个 Agent 准备一个"已经装好依赖、clone 好仓库、启动好 MCP Server"的工作环境, 冷启动成本能省掉一大截。
  • 边界(重要) : README 自己挂了警告 —— 核心概念、协议、规范仍在重度开发, 稳定版前很可能有大规模破坏性变更。而且它强依赖 Agent Substrate(需要先装在集群里), 不是 brew install 就能跑的东西。适合读设计, 不适合现在上生产。

Image
google/ax — Agent 也是一种工作负载

本周观察

三个项目刚好补齐了 9 月 25 日那期缺的拼图。上一期讲的是"底层工具把多 Agent 并行拉低", 讲的是 CLI 和桌面; 这一期直接跳到了"记忆、组织、调度"三件基础设施。

值得注意的是分工: Hindsight 做记忆, Paperclip 做管理, ax 做运行时, 三家没有交集, 互相不替代。这说明 Agent 生态正在从"一个大而全的框架"走向"分层零件" —— 像数据库当年从单体走向 Postgres + Redis + Kafka 那样。对使用者是好事, 意味着可以按需拼装; 对每个项目也是坏消息, 意味着光靠一个亮点拿不到全部价值。

星星数本身也值得说一句。本周 top 3 加起来 34,657 stars, 正好是 Hindsight 单独一个项目的两倍(17,403 × 1.99)。而 star 的增速和项目质量的相关性在 AI 项目上尤其弱 —— 本周最热的两个项目, fork/star 比分别是 16.9% 和 13.2%, 明显高于 google/ax 的 4.9%。真正在用的人和在收藏的人, 从 fork 数上大概能分出一部分。

Hindsight 有个细节值得单独记一笔: 它默认接 PostgreSQL + pgvector, 还提供"嵌入式 pg0"免服务器模式。对 PostgreSQL 圈来说, 这是又一个"新项目直接把 PG 当默认底座"的案例, 跟这两年 pgvector 在 AI 基础设施里的位置变化是同一条线。