【实操sop,有手就会】如何批量处理5000条推文打造ai知识库,还全程不费脑?
昨天,我分享了使用我的5000条推文打造的ai知识库/ai分身。
今天,分享一下操作方法,便于有类似需求的朋友照葫芦画瓢。
整体思路很简单:获取数据——清洗数据——上传。
获取数据
我们之前可能没想过:如何导出我这么多年的所有微信朋友圈\微博\知乎\豆瓣数据。
现在很简单:直接问chatgpt。
所有人说,我知道xxx方法,yyy插件可以做到……
但是,o3回答这个问题是一次 深度研究 过程,而且会综合互联网上的全部方案,综合评价分析。
我们大概知道可以用twitter api(实际上该政策了),可以用xx推特插件(收费免费?效果如何?)^
但是,我们对解决问题的认知,有一个算一个,都是在认知上极大受限的。
以这个案例为例,o3给出了5个方案(极大拓宽了人脑信息获取和加工处理的认知边界),然后提供了不同需求下的方案选择建议(人脑集中有限认知资源在实际的问题解决、思考和、判断和创造上)。
这种级别的问题解决,脱离ai单用人脑使蛮力,是毫无必要的,而且几乎做不到。
此处可以有一个暴论:解决任何问题,都不妨先o3一下。
按照建议向官方发出下载数据的申请后,我等了大概48小时,数据才准备好。下载后一看,1.68GB!
作为普通用户,平时不接触这些后台数据。看着一堆文件夹,以及不熟悉的文件类型,怎么办?
当然还是问ai🤣
定位推文内容所在的文件后,继续问ai:
vibe coding
前面都是准备阶段,一方面准备好原始数据,一方面给大脑解决问题做预热。
下面的主要工作就是清洗数据:把js文件里用json格式封装的内容提取为标准的、格式清晰的、带原始链接的markdown文件。
恭喜你,现在你有机会体验一下最近流行的“vide coding”!
所谓 vibe coding,就是在coding时全程vibe(跟着感觉走),千万不要读代码本身,只用自然语言描述需求,然后ai生成的代码直接复制粘贴运行,出bug后也不读代码,直接复制报错信息,继续让ai生成代码,然后继续复制粘贴……
就是这么抽象!
(vibe coding 是ai大神andrej karpathy在今年2月提出的理念。看似玩笑,实际不是。)
twitter发回来的数据都在tweets.js文件里,
根据chatgpt的提示,把js文件修改为json,
如何把json修改为markdown?只保留你要的正文和链接?
只需要vibe coding,让cursor pro生成一个python脚本即可(convert.py)。
格式不满意?有bug?还有迭代需求?全程复制粘贴,一眼代码都不看,ai给出的修改建议全程点击accept!
然后你得到了满意的结果🤣
数千推文放在一个markdown文件里并不好,我继续vibe coding了一个python脚本,按推文分拆内容。
voila~ 完美解决。
下面就是把你的markdown文件都上传到知识库工具中了。
启示
用vibe coding解决这个问题,简单到有手都会!
这在以前是无法想象的!
现在,每个人都可以,有手都会!无法想象以后我们的孩子,在ai的助力下可以作出怎样我们无法想象的事情。
可以想象:142年前,尼采在《查拉图斯特拉如是说》(高中时最爱的书之一,强烈搭建你加入夜读书单)中提出“超人哲学”(uber mensch)的时候,他对“超人”的最狂野想象,也没有现在的现实更狂野。
一个人在当下能做到的事情,以前完全无法想象(用一下一下这两天我发布的知识库,体会就很具体),甚至几个月前都做不到。现在的世界,在ai的推动下加速进化。尤其是去年9月o1 reasoning model发布后……
不久前的暴论,即将成为每个(有独立判断力)人类的常识:
现在,是人类历史上前所未有的、人类学习的黄金时代》。
虽然ai越来越强,虽然越来越多人落入算法短视频或其他算法陷阱…… 但是,对于一小部分成年人,以及他们的孩子,这就是前所未有的黄金时代。
what a time to be alive.
just keep learning, keep life-learning.
点赞 ♥︎ 转发 ♥︎ 评论