从ChatGPT想到的
好几天没写了,家里生病住院的多。
最近几个月都在说ChatGPT,到现在我自己都没亲身体验过实在汗颜。体验过的你们用什么途径我就不说了,不是有法律说翻墙是违法的吗?就等着百度这个吧。都说文心一言比ChatGPT差一点,有的用就用吧。
计算机在检索方面几个阶段,一个是数据库阶段,比如我们的SQL,一个是文本时代,比如百度谷歌,还有一个是现在这种自然语言处理。我对于自然语言没什么基础,我只是沾了边,最起码基础的数据库还会一点。
然后可以看到各种分析,其中提到的数据、算法、算力。我看到最多的是在说算力如何如何。我不否认这个是必须的。但是我今天想说点我的看法,因为按照节奏这样带,接下来很多就是一些生意了。IDC啊,东数西算,还有什么其他的。这种能堆起来的都不是问题。那些最难的不是算力,而是算法。如果明白人就知道我们和外面差的是基础,不是应用。有些事情一旦变成生意,那就变了。比如自主可控现在就是被炒作成生意了。
我记得前几年有一带一路,然后那个时候什么都是挂上一带一路。所有有些代表和委员建议,警惕什么都打着这个旗号。我也是这个观点,自主可控无可厚非,但是这样炒就不对,没有踏实的解决问题。不知道大家听过没有这个:以前中国的战斗时是第二代的,歼6 歼7 歼8.中国设计的战术对付F22(美国的五代机),提出的是8换一1.为什么?因为F22上只能带8枚导弹,我们派9架歼8,8架去牺牲吸引8枚导弹。最后一架冲上去撞机。听起来很悲壮。后来我们研究了五代机,发现当初就是十架也未必能行。有代差的打不过。所以我个人特别不喜欢说堆机器,不是所有问题用数量都能解决的。举个例子,数据库中索引是最常见的对象。1亿条数据的表中查100条记录,有索引和没索引差别何止万倍。那么我们是研究一下如何建立索引?还是说堆机器,把这上亿的数据分散成1万台机器,每台机器存1万条,还是没索引。靠所谓的算力来解决。还分布式存储和分布式计算了。高大上了。
确实两种都能解决,前者实事求是一点,后者可能宣传或者对于不懂的人来说好一点。但是对于成本来说显然前者的成本几乎0.其实索引就是一种算法。而堆机器是算力。虽然CPU在并行计算方面不如GPU,但是我感觉很多场景连CPU都没发挥出来不是吗?因为其实在各种数据库群大家几乎一致的看法是,当今国内现状是开发不会使用索引,大量全表。所以我们和国外的差距有一大部分是差在基础上。可能外国有些人比较务实,我们有些比较急吧。如果chatgpt后台每次运算都是野蛮计算,我觉得可能也要奔溃了。
做数据库的都知道,分布式数据库挺难的,除了他本身复杂,还有一点是中国特色,那就是很多中小企业,单机足够了。之所以有时候单机不行,不是算力不行,是算法(SQL)不行。