赚大了!Databricks 10亿美元买下开源数据库Neon Database
Databricks花10亿美元买开源Neon数据库, 值得吗?
近期数据库圈又有大买卖了, 有消息称Databricks要花10亿美元买开源Neon数据库.
为什么是Neon? 这背后有什么道道?
一、Databricks是什么?
先问问Qwen3
Databricks(达塔布里克斯) 是一家专注于大数据和人工智能的科技公司,成立于 2013 年,总部位于美国旧金山。它由 Apache Spark 的创始人 Matei Zaharia 创建,致力于提供统一的数据分析与 AI 开发平台。
🌟 Databricks 是什么?
简单来说:
Databricks 是一个基于 Apache Spark 构建的一体化数据与 AI 平台,用于处理海量数据、运行机器学习模型、构建实时应用,并支持团队协作。
🛠️ 核心功能
| 统一平台 | |
| Delta Lake | |
| Databricks SQL | |
| MLflow | |
| Runtimes | |
| Auto Loader |
🚀 主要特点
基于 Apache Spark:性能强大,适合处理 PB 级别的数据。 云原生架构:支持 AWS、Azure、GCP 多云部署。 易用性高:提供 Notebook(类似 Jupyter)、SQL 工具、API 接口等多种开发方式。 企业级安全与治理:支持 RBAC(基于角色的访问控制)、审计日志、数据加密等。
📊 应用场景
| 大数据分析 | |
| 机器学习 | |
| 实时数据处理 | |
| 数据仓库替代方案 |
🏢 典型客户
Databricks 被广泛应用于金融、医疗、零售、制造等多个行业,部分知名用户包括:
Capital One(资本一号) Walmart(沃尔玛) Netflix(奈飞) Goldman Sachs(高盛)
💼 Databricks 的商业模式
SaaS 模式:按使用量计费(CPU/GPU 小时数)。 企业服务:提供定制化部署、私有云解决方案、咨询与培训等服务。
✅ 总结一句话
Databricks 是一个面向企业的大数据与 AI 统一平台,让数据科学家、工程师和分析师能够在同一个环境中高效地处理数据、训练模型并交付价值。
二、Databricks 对未来的判断
要理解Databricks的行为, 只需要了解行为背后的第一性原理是什么.
Databricks要成为大数据与 AI 统一平台, 同时结合它购买Neon database的行为, 倒推出Databricks对未来的判断是什么? (也就是这个购买事件的第一性原理)
1、一切都将被AI化, AI 智能体会遍地开花的爆发, 数量巨多, 有哪些?
C端, 平均每个人拥有超过1个智能体, 这就是几十亿.
B端, 政府、制造业、金融、游戏、教育等各个领域, 每个领域的企业/机构都需要大量智能体.
2、AI 智能体的本质是什么? 大脑 + 记忆(包括会话记录、私有知识库、配置等) + 工具及连接(通过工具调用连接、使用物理世界的其他产品和其他AI agent)
我在这一期谈过, 详见: 《德说-第325期, AI Agent的本质是什么? 如何快速搭建属于自己的agent》
我们重点关注“记忆(包括会话记录、私有知识库、配置等)”, 这个实际上就是数据库. 而且记忆不仅仅有向量、还有标准的结构化数据、非结构化数据等等.
3、云和数据库都是基础设施, 大多数应用都会部署在云上, 大多数人会使用云数据库 (广义的, 包括任何用管控搭建的数据库服务,例如 pigsty, apecloud, clup等)
这个话题在这一期也进行了论述: 《德说-第312期, 什么是基础设施? 什么时候用服务OR自建? 为什么DBA会消失? 我对DBA和数据库厂商的建议是什么?》
三、Databricks 为什么要购买Neon?
Databricks要在AI 智能体数据库赛道获得增长, 必然需要一个云原生 且 同时支持向量+搜索+结构化+非结构化数据存储的数据库. 这是在点名PostgreSQL吗?
https://github.com/neondatabase/neon
https://deepwiki.com/neondatabase/neon
Neon是开源版Aurora, 具有一切想要的云原生能力(弹性、安全、性能、多租户等).
Neon 是一个开源分布式数据库系统,它使用 100% 的 PostgreSQL 作为计算引擎,同时实现了自定义存储层。它将计算与存储分离,允许两者独立扩展,并支持以下功能:
用于开发、测试和 CI/CD 的数据库即时分支 快速计算配置 多租户存储 云部署中的按使用付费定价模型
该项目提供了一个经过修改的 PostgreSQL,它与分布式存储系统(而非本地文件)协同工作。该存储系统由存储、处理和向计算节点提供数据的组件组成。
关键组件
代理:处理客户端连接、连接池和 HTTP 上的 SQL 计算节点:修改后的 PostgreSQL 实例,使用 Neon 存储引擎而不是本地文件 页面服务器:存储和管理数据页面,并根据请求将其提供给计算节点 Safekeeper:通过共识协议确保 WAL 的持久性 存储控制器:管理存储层的租户放置和分片 远程存储:数据的长期存储(S3、Azure Blob 存储或本地文件) 控制平台:整个系统的管理服务
Neon 使用多租户模型来组织数据,每个租户都有时间线(分支)。
租户和时间线
租户:逻辑数据库实例,类似于 PostgreSQL 集群 时间线:租户的分支,允许独立开发和测试 (类似github的branch功能) 时间线分支:创建一个从父时间线的特定 LSN(日志序列号)开始的新时间线
存储组织
页面服务器层:数据被组织成不同类型的层: 镜像层:数据页的完整快照 Delta Layers:数据页的增量变化 内存层:最近的更改尚未保存到磁盘 Safekeeper WAL 存储:按租户和时间线组织的预写日志记录
数据流
写入路径
客户端向代理发送 SQL 查询 代理将请求转发到计算节点 计算节点执行查询并生成 WAL 记录 WAL 记录被发送到 Safekeeper 以确保持久性 Safekeeper达成共识并承认写入 Safekeeper 将 WAL 传输到 Pageserver Pageserver 将 WAL 应用于其页面缓存并创建层 Layers 最终上传到远程存储
读取路径
客户端向代理发送 SQL 查询 代理将请求转发到计算节点 计算节点需要读取数据库页面 计算节点从页面服务器请求页面 页面服务器从其缓存中提供页面或从层中检索页面 计算节点执行查询并返回结果
为什么要购买Neon?
可能令Databricks看重的是它的
云原生能力, 最终可以打出性价比优势, 满足盈利要求. PG原生的能力, 满足技术要求.
10亿美元是否值得? 相信Databricks精算过. 我们不必担心. 看看Aurora的财报, 可能10亿美刀太便宜了.
以下数据来自文章 <Neon将照亮Postgres市场>
所有人都是凡人, 大家都是因为看见所以相信, 现在相信PG有钱途还不晚, 快看: