PostgreSQL Hybrid能力岂非“小趴菜”数据库可比 ?
❝开头还是介绍一下群,如果感兴趣PolarDB ,MongoDB ,MySQL ,PostgreSQL ,Redis, OceanBase, Sql Server等有问题,有需求都可以加群群内有各大数据库行业大咖,可以解决你的问题。加群请联系 liuaustin3 ,(共3300人左右 1 + 2 + 3 + 4 +5 + 6 + 7 + 8 +9)(1 2 3 4 5 6 7群均已爆满,开8群近400 9群 200+,开10群PolarDB专业学习群 7月份开课)
PostgreSQL 是开源数据库中hybird的头牌,对开源数据库中的小趴菜,上次已经说了它,招致一些“谩骂”,但是事实如此,骂的越凶,越是心虚的表现,从本期开始将用多期来说明PostgreSQL和其他的数据库在hybird的“大展宏图”,当然“小趴菜”那个数据库是做不到的。
被骂后的文字--技术人不脱离思维困局,终局是个 “死” ? ! ......
今天我们来实际的深入PostgreSQL的hybird功能,将混合查询完美的在PostgreSQL中实现。 首先我们先准备好一个PostgreSQL数据库,这里我们使用PostgreSQL16 这个版本来进行相关的工作。
这里我将使用pgvector ,GIN/Gist+tsvector,先进行第一期的Hybird的介方案介绍。pgvector是PostgreSQL 开源扩展,它为PostgreSQL 提供了高效存储,检索和向量相似的搜索能力。他将PostgreSQL变成了一个向量数据库。这也是PostgreSQL数据库之美的重要组成部分,俗称万能的PostgreSQL的由来就是这么来的。
PostgreSQL 引入了vector数据类型,在表中存储高维向量,ruembedding vector(1536),其核心功能是计算向量之间的距离,或近似度,找到用户查询向量最相似的K个向量。支持多种距离度量。其中主要的应用场景为语义搜索,问答系统,或者推荐系统,重复的内容方面的检测,以及异常检测等。使用的应用范围和场景非常的多。
下面我们将实际来操作我们的pgvector
postgres=# create extension vector;
CREATE EXTENSION
postgres=# \c test
You are now connected to database "test" as user "postgres".
test=# create extension vector;
CREATE EXTENSION
test=# CREATE TABLE documents (
test(# id SERIAL PRIMARY KEY,
test(# title TEXT,
test(# content TEXT,
test(# category TEXT,
test(# published_date TIMESTAMP,
test(# embedding VECTOR(10)
test(# );
AS published_date,
(
SELECT
'[' || string_agg(
(round(random()::numeric * 100) / 100)::text,
', '
) || ']'
FROM
generate_series(1, 10)
)::vector
FROM
generate_series(1, 100000) as i;
CREATE INDEX ON documents USING ivfflat (embedding vector_cosine_ops)
WITH (lists = 100);
CREATE INDEX ON documents (category);
CREATE INDEX ON documents (published_date);CREATE TABLE
test=#
test=# INSERT INTO documents (title, content, category, published_date, embedding)
test-# SELECT
test-# 'document ' || i::text AS title,
test-# 'topic ' || (i % 10)::text || ' detail info。' AS content,
test-# CASE i % 3
test-# WHEN 0 THEN 'tech'
test-# WHEN 1 THEN 'ai'
test-# ELSE 'business'
test-# END AS category,
test-# now() - (random() * 365)::int * interval '1 day' AS published_date,
test-# (
test(# SELECT
test(# '[' || string_agg(
test(# (round(random()::numeric * 100) / 100)::text,
test(# ', '
test(# ) || ']'
test(# FROM
test(# generate_series(1, 10)
test(# )::vector
test-# FROM
test-# generate_series(1, 100000) as i;
INSERT 0 100000
test=#
test=# CREATE INDEX ON documents USING ivfflat (embedding vector_cosine_ops)
test-# WITH (lists = 100);
CREATE INDEX
test=#
test=# CREATE INDEX ON documents (category);
CREATE INDEX
test=#
test=# CREATE INDEX ON documents (published_date);
CREATE INDEX
test=#
第一种查询方式,查询向量近似度查询
test=#
test=# SELECT id, title, content, category, published_date, embedding <#> '[0.1, 0.2, -0.1, 0.3, 0.0, -0.2, 0.4, -0.3, 0.1, 0.05]' AS distance
test-# FROM documents
test-# ORDER BY distance
test-# LIMIT 5;
id | title | content | category | published_date | distance
----+------------+-----------------------+----------+----------------------------+----------------------
2 | document 2 | topic 2 detail info。 | business | 2025-04-05 05:21:57.528955 | -0.40450000762939453
3 | document 3 | topic 3 detail info。 | tech | 2024-08-02 05:21:57.528955 | -0.40450000762939453
4 | document 4 | topic 4 detail info。 | ai | 2024-07-15 05:21:57.528955 | -0.40450000762939453
5 | document 5 | topic 5 detail info。 | business | 2024-08-25 05:21:57.528955 | -0.40450000762939453
1 | document 1 | topic 1 detail info。 | ai | 2025-04-04 05:21:57.528955 | -0.40450000762939453
(5 rows)
带有删选条件的向量近似度查询语句
SELECT id, title, content, category, published_date, embedding <#> '[0.1, 0.2, -0.1, 0.3, 0.0, -0.2, 0.4, -0.3, 0.1, 0.05]' AS distance
FROM documents
WHERE category = 'ai'
ORDER BY distance
LIMIT 5;
把日期加入到查询中
test=# SELECT id, title, content, category, published_date, embedding <#> '[0.1, 0.2, -0.1, 0.3, 0.0, -0.2, 0.4, -0.3, 0.1, 0.05]' AS distance
test-# FROM documents
test-# WHERE published_date BETWEEN '2024-01-01' AND '2024-12-31'
test-# ORDER BY distance
test-# LIMIT 5;
id | title | content | category | published_date | distance
----+-------------+-----------------------+----------+----------------------------+---------------------
-
4 | document 4 | topic 4 detail info。 | ai | 2024-07-15 05:21:57.528955 | -0.40450000762939453
5 | document 5 | topic 5 detail info。 | business | 2024-08-25 05:21:57.528955 | -0.40450000762939453
6 | document 6 | topic 6 detail info。 | tech | 2024-07-14 05:21:57.528955 | -0.40450000762939453
17 | document 17 | topic 7 detail info。 | business | 2024-11-23 05:21:57.528955 | -0.40450000762939453
3 | document 3 | topic 3 detail info。 | tech | 2024-08-02 05:21:57.528955 | -0.40450000762939453
(5 rows)
查询与条件不相符的数据
SELECT id, title, content, category, published_date, embedding <#> '[0.1, 0.2, -0.1, 0.3, 0.0, -0.2, 0.4, -0.3, 0.1, 0.05]' AS distance
FROM documents
ORDER BY distance DESC
LIMIT 5;
查询余弦距离查询,这是衡量两个向量之间不相似的程度的一种指标。
test=# SELECT id, title, content, category, published_date, embedding <=> '[0.1, 0.2, -0.1, 0.3, 0.0, -0.2, 0.4, -0.3, 0.1, 0.05]' AS cosine_distance
test-# FROM documents
test-# ORDER BY cosine_distance
test-# LIMIT 5;
id | title | content | category | published_date | cosine_distance
----+-------+---------+----------+----------------+-----------------
(0 rows)
test=#
今天针对PostgreSQL的Hybrid search能力进行简单的综合的评测和测试,相对于“小趴菜”那种数据库产品,PostgreSQL用自己真实的实力和能力让谩骂者相形见绌。还是那句话"小趴菜” 数据库不行就是不行,有那个功夫卖弄嘴皮子,不如干点正事,当然如果粗俗的语言是你的工作,就继续吧,终究咱们这也不是断案的地方是吧。
置顶
免费PolarDB云原生课程,听课“争”礼品,重塑云上知识,提高专业能力
9个群2025上半年总结,OB、PolarDB, DBdoctor、爱可生、pigsty、osyun、工作岗位等
用MySQL 分区表脑子有水!从实例,业务,开发角度分析 PolarDB 使用不会像MySQL那么Low
云数据库产品应改造PostgreSQL逻辑复制槽缺陷--来自真实企业的需求
泉城济南IvorySQL 2025 “雷暴云” 就在云和云原生会场
SQL SERVER 2025发布了, China幸亏有信创!
MongoDB 麻烦专业点,不懂可以问,别这么用行吗 ! --TTL
PostgreSQL 新版本就一定好--由培训现象让我做的实验
删除数据“八扇屏” 之 锦门英豪 --我去-BigData!
写了3750万字的我,在2000字的OB白皮书上了一课--记 《OceanBase 社区版在泛互场景的应用案例研究》
跟我学OceanBase4.0 --阅读白皮书 (OB分布式优化哪里了提高了速度)
跟我学OceanBase4.0 --阅读白皮书 (4.0优化的核心点是什么)
跟我学OceanBase4.0 --阅读白皮书 (0.5-4.0的架构与之前架构特点)
跟我学OceanBase4.0 --阅读白皮书 (旧的概念害死人呀,更新知识和理念)
MongoDB 相关文章
MongoDB “升级项目” 大型连续剧(4)-- 与开发和架构沟通与扫尾
MongoDB “升级项目” 大型连续剧(3)-- 自动校对代码与注意事项
MongoDB “升级项目” 大型连续剧(2)-- 到底谁是"der"
MongoDB “升级项目” 大型连续剧(1)-- 可“生”可不升
MongoDB 大俗大雅,上来问分片真三俗 -- 4 分什么分
MongoDB 大俗大雅,高端知识讲“庸俗” --3 奇葩数据更新方法
MongoDB 大俗大雅,高端的知识讲“通俗” -- 2 嵌套和引用
MongoDB 大俗大雅,高端的知识讲“低俗” -- 1 什么叫多模
MongoDB 合作考试报销活动 贴附属,MongoDB基础知识速通
MongoDB 使用网上妙招,直接DOWN机---清理表碎片导致的灾祸 (送书活动结束)
MongoDB 2023年度纽约 MongoDB 年度大会话题 -- MongoDB 数据模式与建模
“PostgreSQL” 高性能主从强一致读写分离,我行,你没戏!
POLARDB 添加字段 “卡” 住---这锅Polar不背
PolarDB 版本差异分析--外人不知道的秘密(谁是绵羊,谁是怪兽)
PolarDB 答题拿-- 飞刀总的书、同款卫衣、T恤,来自杭州的Package(活动结束了)
PolarDB for MySQL 三大核心之一POLARFS 今天扒开它--- 嘛是火
PostgreSQL 无服务 Neon and Aurora 新技术下的新经济模式 (翻译)
“PostgreSQL” 高性能主从强一致读写分离,我行,你没戏!
全世界都在“搞” PostgreSQL ,从Oracle 得到一个“馊主意”开始
PostgreSQL 加索引系统OOM 怨我了--- 不怨你怨谁
PostgreSQL “我怎么就连个数据库都不会建?” --- 你还真不会!
PostgreSQL 稳定性平台 PG中文社区大会--杭州来去匆匆
PostgreSQL 分组查询可以不进行全表扫描吗?速度提高上千倍?
POSTGRESQL --Austindatabaes 历年文章整理
PostgreSQL 查询语句开发写不好是必然,不是PG的锅
MySQL相关文章