DuckDB v2.0 换掉了用了8年的SQL解析器
DuckDB 在 8 月 17 日预告了 v2.0 的十项新特性(服务器模式、触发器、VARIANT 类型、异步 I/O 等),三天后,团队又发了一篇深度技术博文,专门讲一个听起来很底层的改动——换解析器。
阅读全文 :DuckDB v2.0 换掉了用了8年的SQL解析器
专注于数据整合、机器学习、企业信息化、自动化
DuckDB 在 8 月 17 日预告了 v2.0 的十项新特性(服务器模式、触发器、VARIANT 类型、异步 I/O 等),三天后,团队又发了一篇深度技术博文,专门讲一个听起来很底层的改动——换解析器。
阅读全文 :DuckDB v2.0 换掉了用了8年的SQL解析器PCA、线性回归、协同过滤、因子分析——转一圈下来,最后都是 SVD、特征分解这类 LAPACK 算子在干活。DuckDB 的 SQL 很快,但真要算矩阵,只能把数据搬出去,用 Python 算完再搬回来。
阅读全文 :duckdb-luajit 接上 GPU:SQL 里算 SVD 快了 18 倍DuckDB 的 SQL 再强,SELECT 也算不出一组特征值。以前的办法:导出数据给 Python,调 numpy.linalg,算完再导回来。
阅读全文 :duckdb-luajit 加矩阵计算,SQL 里做 SVD 特征分解duckdb-luajit实战:比如排产。仓库里 300 个订单,3 条产线,每条产线工时、物料、交期都不一样,怎么排才能让总成本最低?比如运输。3 个工厂往 3 个城市发货,运费不同、产能不同、需求不同,怎么调才最省?
阅读全文 :duckdb-luajit 接上 scipy 求解器,SQL 里解线性规划同一个算法,在 SQL 里能用 5 种方式实现,而且速度差近 6 倍
阅读全文 :duckdb-luajit: 同一道数独,5 种写法,快 6 倍DuckDB 的扩展生态有 301 个社区扩展,parquet、iceberg、postgres 什么都有,但中国格式一个都没有。数电发票、OFD 版式、GBK 编码、券商流水,全是空白。
阅读全文 :DuckDB 读不了数电发票,283 行 Lua 批量搞定每天凌晨 2 点同步订单表,全量重跑 10 分钟——其实一天就多了几百行新数据。客户维度改个地址,直接 UPDATE 覆盖,历史状态就没了,想查"他去年住哪"翻不到。增量加载 + 维度历史,数据工程师的日常,但每次都要手写水位游标、手写版本表。
阅读全文 :DuckDB 可以增量加载吗?维度历史呢?duckdb_luajit实战:做一个完整的 ETL 引擎——从数据接入、清洗转换、质量检查到落库,一条管道跑完,每个环节自动记审计。
阅读全文 :DuckDB 的 Luajit 扩展里,我塞了个 ETL 引擎duckdb_luajit实战:SQL 里的 Lua UDF 直接发布成 MCP tool
阅读全文 :DuckDB 里的 Luajit UDF,成了 AI 能调用的工具DuckDB 什么都快,就是没有存储过程。官方文档说得直白:procedures in DuckDB are implemented as table functions
阅读全文 :我用 Lua 实现了DuckDB 存储过程我一直在用 DuckDB。做数据分析的时候,图计算的需求经常冒出来——但要为此单独搭一个 Neo4j 或装一个 NetworkX,太重了。
阅读全文 :我在 DuckDB 里塞了一个图算法引擎写代码时默认不写注释。绝不写多段落文档字符串或多行注释块——最多一行。除非用户明确要求,不要创建规划、决策或分析文档。
阅读全文 :你写给 AI 的"员工手册",正在让它变蠢不用微服务、不用 Redis、不用 AI——这个热榜聚合器拿了 21K stars 你有多久没打开微博热搜了? 不是因为不关心热点,而是因为打开一个 App 只看热榜太麻烦。微博、知乎、百度、B站、36氪、华尔街见闻……每个平台都有一套热榜
阅读全文 :不用微服务、不用Redis、不用AI——这个热榜聚合器拿了21K stars给 DuckDB 写了个 Rust 扩展,把 CPython 塞了进去。py_register('double_it', 'str(int(x)*2)', 1) 之后,SELECT double_it('21') 直接返回 42。
阅读全文 :在 SQL 里直接写 Python——我做了一个 DuckDB 扩展