别被忽悠了|这个领域AI还替代不了人类
AI就是温室里的花朵, 步入社会就蔫了
近年来,像GPT-4这样的大语言模型在许多任务上表现惊人,尤其是在一些学术性的Text-to-SQL(文本到SQL)基准(如Spider)上取得了很高的分数 。这让人们产生了一个疑问:我们是不是很快就可以用自然语言和数据库自由对话,不再需要专业的数据库分析师了?
现实并非如此。之前流行的学术基准存在一个巨大缺陷:它们过于“干净”和“理想化”,与真实世界的数据库应用场景脱节 。
数据库规模小:大部分基准的数据库只有几千行数据,而真实世界的数据库动辄上千万甚至上亿行 。 数据质量高:学术数据非常规整,而现实中的数据充满了格式不一、有特殊符号的“脏数据” 。 不关心效率:只要SQL查询结果正确就行,不考虑查询速度。但在大型数据库上,一个低效的查询可能要运行数小时,这是无法接受的 。
为了弥补这一差距,BIRD (BIg bench for large-scale Database grounded text-to-SQL) 诞生,一个专为模拟真实世界挑战而生的新“考场” 。
提前揭晓答案, AI目前还无法替代DBA, 因为在这个榜单上人类得分93远超最强AI得分77.
要替代人类DBA, AI得先过第1关
作为资深DBA, 如何评测基于LLM的 text-to-SQL 产品是否靠谱? 你能想到什么评测点?
支持哪些数据库产品、版本? 如果是PG, 可能还涉及插件及插件的版本等. 识别数据内的采样数据、元数据、描述等结合用户问题生成SQL的正确性? SQL运行结果正确性? SQL运行效率? 覆盖哪些SQL语法? 是否能过滤问题中的噪音, 例如错误的数字( us 5,000), 中英文混搭、LLM幻觉问题等等.
我大概会想到以上几点.
紧接着就会问, 有没有这样的评测产品呢?
前面已介绍了, 就是 BIRD-SQL (A Big Bench for Large-Scale Database Grounded Text-to-SQLs) , 也许现在还不是非常完美, 但是它是开源的, 它可以继续迭代.
https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/bird https://bird-bench.github.io/
BIRD-SQL 是一系列数据样本和评测标准, 试图回答这个问题 “Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs” (LLM目前是否具备作为数据库服务接口的能力?) .
BIRD(BIG Bench for Large-Scale Database Grounded Text-to-SQL Evaluation)是一个开创性的跨领域数据集,用于检验海量数据库内容对 Text-to-SQL 解析的影响。BIRD-SQL 包含超过12,751 个独特的问题对, 95 个大型数据库,总大小达33.4 GB。它还涵盖了37 个专业领域,例如区块链、曲棍球、医疗保健和教育等。
相关论文
https://arxiv.org/pdf/2305.03111 ( Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs)https://arxiv.org/pdf/2405.15307 ( Before Generation, Align it! A Novel and Effective Strategy for Mitigating Hallucinations in Text-to-SQL Generation)https://arxiv.org/pdf/1809.08887 ( Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task)
《BIRD-SQL 论文解读》
已经有很多模型参与了测试, 这个榜单也在不断更新, 有望成为Text-to-SQL领域的标准榜单.
目前榜单上最强的开源NL2SQL项目是: https://github.com/XGenerationLab/XiYan-SQL
更多请参考该项目介绍: https://github.com/AlibabaResearch/DAMO-ConvAI/tree/main/bird
BIRD-SQL 是首个跨领域的大规模基准测试,旨在弥合 Text-to-SQL 解析领域学术研究与实际应用之间的差距。尽管 Codex 和 ChatGPT 等模型已展现出卓越的性能,但 Spider 和 WikiSQL 等现有基准测试主要侧重于数据库 schema,而数据库内容(data: 数据记录等)则在很大程度上未被探索。意识到这一局限性,BIRD着手创建一个全面的基准测试,深入探究数据库的价值,最终揭示 Text-to-SQL 领域发展的新挑战和机遇。
BIRD-SQL 以其庞大的数据集而闻名,该数据集包含12,751 个文本到 SQL 对,涵盖37 个专业领域的95 个数据库,总大小达33.4 GB。通过突出数据库值,BIRD-SQL 关注新的挑战,例如外部知识、脏数据以及海量数据库中的 SQL 效率。为了生成准确的 SQL 查询,模型不仅要进行语义解析,还要理解数据库值。
还要过第2关
做AI4DB的应用, 绕不开2个应用场景:
1、NL2SQL (Text-to-SQL) 2、解决用户使用数据库过程中遇到的复杂SQL问题
应用做得好不好? 总要有评测标准吧?
第一关提到的开源项目: BIRD-SQL 解决了第一个应用场景的评测标准, 这个项目是一系列数据样本和评测标准, 试图回答这个问题 “Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs” (LLM目前是否具备作为数据库服务接口的能力?) .
第2个场景的评测标准呢?
又一个bird开源项目来了, BIRD-CRITIC 项目包含了人类在使用各种流行数据库时遇到的一系列问题, BIRD-CRITIC 试图回答这个问题 “Can large language models (LLMs) fix user issues in real-world database applications?” (LLM是否具备解决人类在真实世界遇到的各种数据库问题的能力?) .
https://github.com/bird-bench/BIRD-CRITIC-1 https://github.com/bird-bench
BIRD团队与谷歌云合作, 首个 SQL 诊断基准测试 BIRD-CRITIC(又名 SWE-SQL)发布,旨在回答:大型语言模型 (LLM) 能否解决实际数据库应用中的用户问题? 该基准测试包含 600 个开发任务和 200 个 (OOD) 测试。BIRD-CRITIC 1.0 基于四种主要 SQL 方言(MySQL、PostgreSQL、SQL Server 和 Oracle)中实际的用户问题构建。它超越了简单的 SELECT 查询,涵盖了更广泛的 SQL 操作,反映了实际的应用场景。最后,它包含一个优化的基于执行的评估环境,用于进行严格而高效的验证。
以下测试基准数据都可以在huggingface中下载:
bird-critic-1.0-flash-exp :一个精简版本,包含200 个PostgreSQL 任务。这是一个快速实验的良好起点。 bird-critic-1.0-open : BIRD-CRITIC 的完整版本,包含570 个任务,涵盖开源 SQL 方言:PostgreSQL、MySQL、SQL Server 和 Oracle。这允许跨方言评估。 bird-critic-1.0-postgresql :完整版本,包含530 个任务,全部使用 PostgreSQL 语言编写。这使得用户能够针对单一方言进行集中分析。 bird-critic-1.0-bigquery:包含BigQuery 中 200 个任务的完整版本。
Google对PG也是大爱啊, 入门使用PG, 还包含一个大PG多任务版本.
bird-critic 问题集例子:
PostgreSQL 相关榜单如下:
目前排在排行榜第一位的得分居然如此低,也就是解决不了啥问题呗: ByteBrain-Agent + deepseek-r1
更多详情请参考bird-critic官网:
https://bird-critic.github.io/
要与人类水平持平, 再修炼修炼
但是AI发展太快了, 谁也说不清到底什么时候AI就超过人类高级DBA了.
当然低级DBA也不用AI来替代,因为迟早会删库跑路。
如果你正在设计AI text-to-SQL或智能诊断产品, 时刻关注BIRD项目和榜单的更新吧!
本号马上快1万粉了,给粉丝们准备了一些小礼物。参与方法很简单:“关注本号及IF-Club的号、并在任何有本活动的文章下面留言”,sum(点赞数) group by uid order by sum desc limit 5的小伙伴将获得小礼物(每个uid每篇中只取最高点赞数的1条)。
到1万粉就开奖,冲鸭 ... ...
感谢 IF-Club社区赞助礼品,C姐最美。
记得关注:
最后再啰嗦一句, 如果你有国产数据库需求, 欢迎来撩.
讲真,随便哪家国产数据库,就没有我能勾搭的!