DuckDB 周报 #9:dbt v2 自带适配器,直查 HF 数据集
dbt v2 开始内置 DuckDB 适配器;官方详解 hf:// 协议直查 Hugging Face 数据集;社区扩展一周净增 57 个。
阅读全文 :DuckDB 周报 #9:dbt v2 自带适配器,直查 HF 数据集
专注于数据整合、机器学习、企业信息化、自动化
dbt v2 开始内置 DuckDB 适配器;官方详解 hf:// 协议直查 Hugging Face 数据集;社区扩展一周净增 57 个。
阅读全文 :DuckDB 周报 #9:dbt v2 自带适配器,直查 HF 数据集只写列名,让 DuckDB 自己学会造假数据 给 DuckDB 灌测试数据这事,我最近翻车过一次,翻得很彻底:屏幕上 18 行数据,每一行都是 18|New York|James Smith。 一模一样。
阅读全文 :只写列名,让 DuckDB 自己学会造假数据OAG 解决的不是 AI 找不到知识,是不知道自己能对知识做什么。Palantir 五年前造的词,现在轮到用友接盘。
阅读全文 :Palantir 的 OAG:AI 找到了文档,但不知道能干什么文本分类训练和预测都进了 SQL:757KB Rust 内核经 LuaJIT FFI 挂进 duckdb-luajit,自带温度校准和 Clopper-Pearson 阈值推荐,不调 API 不出库。
阅读全文 :duckdb-luajit:中文工单分类,在 SQL 里训练模型Jev 不生成 token,只读概率。这篇把整套搬到本地:Qwen-4B 跑 llama.cpp,一条 SQL 扫完一列,1000 行 87.3%,附三个厂商博客不会写的坑。
阅读全文 :不用 TypeSafe:本地 DuckDB 跑 Jev同一个 4B,只把读出方式换了一种,分类从 24/37 变 40/40;Mac 上的 35B 两遍满分。
阅读全文 :docjev 换本地引擎:4B 从 24/37 到 40/40,没换模型一条过万浏览的 Jev 清单,8 个项目逐个用 API 核了一遍:8 个都在,1 个跟 Jev 没关系;顺着清单还摸到三家供应商、两条把 Jev 接进 agent 循环的 fork。
阅读全文 :Jev 的 8 项目清单:1 个无关,星最多的没进Jev 说自己不会幻觉。官方配图的脚注里写着那个 0% 不是实测出来的,是格式保证推出来的;再加上官方自列的九条失败模式,这句话该打几折就有数了。
阅读全文 :Jev 的「不会幻觉」,官方自己在脚注里打了折mariabackup 跑完 exit 0、日志零提示,DuckDB 表的数据一个字节没进备份。备份、恢复、binlog 三条链路在官方镜像里跑了一遍,附三条选路建议。
阅读全文 :MariaDB 的 DuckDB 引擎,备份成功了,数据没进去DuckDB 社区新扩展 gatekeeper 不执行 SQL 也能判权限:套了视图的敏感表照样被点名,但给代理用的强制连接还没进二进制
阅读全文 :DuckDB 装了 gatekeeper:AI 写的 SQL,先过检再执行GB/T 48000.3-2026 已实施。网上流传的多半还是 40 页起草稿:名称改为「要求」,「公理」是定稿才加的。
阅读全文 :本体建模要求:40 页起草稿,47 页正式版,差在哪上篇讲怎么装那个 292MB 的二进制;这篇讲不装:把 usql 的核心编进 DuckDB 的 Lua,连接常驻进程内,200 次持续查询 6.1 到 6.6 毫秒;再给桥加一条原生 Parquet 通道,类型和字节都不丢。
阅读全文 :不装二进制也能查 40 种数据库:把 usql 编译进 DuckDB 的 Lua 里DuckDB 原生扩展只覆盖主流库。用一个 Lua 表函数调本机 CLI(sqlite3/psql/usql),把长尾数据库当表读进来——含两个只有跑一遍才会踩到的坑。
阅读全文 :让 DuckDB 用一条 SQL 查 40+ 种数据库:一个 Lua 文件 + 一个 292MB 的二进制在 DuckDB 的 LuaJIT 扩展里用 ffi.load 调 Go 共享库:链路通了,冷启动两三毫秒,但简单替换比 Lua 原生慢 4 倍。
阅读全文 :duckdb-luajit:Lua 里调 Go,比 Lua 原生慢 4 倍同一份病历,结构化列与正文日期共用一条时间轴:三刀脱敏都在 DuckDB SQL 里完成
阅读全文 :duckdb-luajit:病历出域前三刀脱敏,全在 SQL 里DuckDB 没有数据脱敏能力。这个扩展把它补成了一条 SQL,还能自己给出 k/l/t 效果报告。
阅读全文 :duckdb-luajit: 一条 SQL 脱敏,还能自证脱够了前面四篇,我们拆开了每一步:MIMIC 数据怎么拿、31 个模板怎么设计、模板路由怎么做到 96.8%、OMOP 本体怎么补上概念查询。 这篇把它们串起来
阅读全文 :DuckDB实战:从数据库到 DataAgent:MIMIC 工作流完整链路ICU 每秒都在产生数据:4.3 亿条记录的监护数据 「ICU 数据量大」是个抽象说法。到底多大? 我们把自己的 MIMIC-IV 副本(从 PhysioNet 申请下载,见本系列第一篇)转成 Parquet 后,跑了一遍统计。
阅读全文 :DuckDB实战:ICU 每秒都在产生数据,4.3 亿条记录怎么查上一篇文章里,我们把 MIMIC 变成了 31 个模板。模板解决「怎么查」的问题,但还有一个更隐蔽的问题:查什么? 「查脓毒症患者」——听起来很简单。
阅读全文 :OMOP 本体:字面查询漏掉 57% 的脓毒症患者AI 写 SQL 查数据,答对答错怎么判定? 直觉做法:拿 AI 的结果和「标准答案」比。但医疗数据没有标准答案:同一个问题,不同写法、不同条件,结果都不一样。
阅读全文 :怎么证明 AI 答对了:golden 快照与评测的坑