在这个界面上,你就能看到,所谓的AIHOT共识分了。这个分数的背后,其实就是我自己挑选出来的一些我觉得真的有参考意义的一些排行榜了,第一批一共10个,后面还会加,大家如果有觉得非常靠谱的且新的,也可以给我反馈。而你点击这个地方,也能进入我们参考的所有排行榜的界面。这里把大家的榜单都集成过来了,方便大家查看,当然,也放了跳转源网址的快捷入口,方便大家去源站看其他的信息。而你如果回到排行榜首页,每个模型本身也可以点击,去到他们的详情页,看看每个来源,给他们的打分和排行分别是多少。讲道理,如果不做外面的那个AIHOT的共识分,只做一下集成,把大家的数据放到这,定时更新,其实挑选来源大概2小时,Codex按我的流程现在开发,最多3小时,半天怎么滴也就能搞完了。但是吧,我自己还是觉得,如果纯粹的只是集成展示,还是不够有意思。包括这也是我自己一直想知道的,如果把这些排行榜的数据,都汇聚在一起,出一个新的排行榜,就是大家的共识榜,那是不是就肯定有意思多了。人的很多念头啊,只要你起念的那一刻,那再也不会消下去了。于是,这一个周末的时间,我几乎把所有的时间都铺在了这个上。起初我想的特别简单,我觉得这个排名不是挺好算的吗?就是比如说我有10个榜,比如Kimi K3这个模型,在那个榜单上排第1,在那个榜单上排第2,在那个榜单上排第5,我直接取个平均数,就能算出来它的综合排名2.66,然后所有模型一起来比这个综合排名,不就搞定了。但是当实际把那些数据拿出来的时候,我才发现,这个方案就纯纯是拍脑袋的呆逼方案,问题实在太多了。比如,同样是第5,在一张只有10个模型的榜里,只能算中游,但是在一张有200个模型的榜里,已经是最顶尖的了,这两个第5的含金量能是一回事吗?比如,这个榜的第1领先第2领先了30%,另一个榜单里,第1只比第2多了0.01分,领先的幅度微乎其微,这个领先幅度,能是一回事吗?而且还有一个特别现实的事情就是,有的榜他更新就是慢半拍,有的榜他就是不跑某个特定的模型,于是同一个模型,可能在6个榜里是有它身影的,但是在另4个榜里,却处于缺失状态。如果给它填0分,这肯定不行啊,它只是没测又不是真零蛋,你填平均分,那对其他人也不公平,如果你只平均它参加过的6张榜,又会把这6张榜的影响莫名其妙的放大,导致也不客观。这个时候,我才发现这个事的棘手程度,而且不止这个算法,我才发现,每一个榜单上,大家的模型名称,还有评测的规则,还有命名规范,全都不一样,这又给我带来了一些工作量,不过这个好解决,就是纯粹的工程化问题。我建一个我们自己的中心模型名称库,然后把其他榜单的名称全部映射过来,就非常快的速度就解决了。于是在周六,我就开始跟AI一轮一轮的聊,一轮一轮的去学习和探索。这个时候你会发现,如果我们只在Codex里面,让它根据我们的代码和项目来去探索,效果是稀巴烂,基本上就是一个快沉的满身漏洞的大船,它疯狂的给你想着怎么打补丁,但是真正的本质是,我们得换一艘不会漏水的船。所以呢,这个时候我一般会把我自己的坑,还有这些问题给梳理出来。我直接打开ChatGPT的5.6 Sol Pro,来去跟他聊。相信我,这个模型,绝对不比Claude Fable 5差,很强,非常强,尤其是在讨论方案上,强的离谱。然后我一般的方法呢,不是让它在自己的领域里面去找,而是把我的困惑和我的问题,还有这个事情的背景说给它听,同时问它,人类历史上有没有过类似的解决方案。这个时候你会发现你的思路瞬间就会被拓宽了,人类的局限,很多时候就是因为自己的知识,因为每一个人的能力都过于渺小。而如果你在找一个方案的时候,只局限在自己的领域,你会发现你经常会撞上南墙。可人类的知识本就浩瀚如星海,你的领域解决不了,那有没有可能,其他的领域是可以解决的呢?在教育这个事呢,在很久以前就遇到过了。比如说不同的学生,他做的试卷不一样,那题目难度也不一样。单纯的比较卷面的总分,其实是并不公平的。那所以后面我们有了一整套的方法,它可以从你的答题结果里面去评估一个看不见的潜在分数。在电竞里面也有类似的机制,特别是竞技类游戏,一个可能只打了几十场,把把超神的人,你不可能还给他匹配同样打了几十场的萌新吧?这个机制,被大家亲切的称为Elo机制。微软也有一个自己的项目,叫TrueSkill,是一种更偏团队更高级的游戏匹配系统。那从这两条路去归纳,最后我们找到了一个非常非常适合我们现有数据的成对比较方法,同时又做了一些定制化的改良。底层叫Bradley-Terry,同时又加了先验来限制小样本结果的评分。
它大概的意思呢,就是我们核心看的是模型之间真正发生过的PK和较量比如两个模型同时出现在了一张榜单里面,那谁高谁就赢了一场。然后把所有榜单里面真实发生过的一些胜、负、平,最后放到了一张巨大的网里面,反过来推算模型背后真正的那个能力值。那有些模型可能互相之间从来没有在同一张榜单里面出现过,那也没有关系,只要它们分别跟同一批对手交过手,那整张大网络仍然可以把它们连起来。比如某个榜单里面缺了A,就导致A没有直接打过B,但在另一个榜单里面,A打过C,B也打过C,当这样的共同对手足够多以后,这时候我们就可以根据它们的分数大概来去推断A和B的能力值和它们的关系了。
当然,大模型的榜单跟电竞还是有一些区别,因为来源之间会互相重叠,小榜的偶然性会更强,证据太少的模型也可能因为刚好赢了几场,就算出一个特别离谱的能力值。
于是我们又做了很多的工作,比如做了一些叫证据预算的东西,又加了一些先验。而且为了我们归一到100分制,我们又冻结了一组锚点模型,用它们来定义共识分的刻度。
那最终呢,这套榜单我们的实现方式,AI给我取了个名字,叫:
LatentRank。
在这套规则下,前5名就是这几个。
Opus 5超过Fable 5我还是有点意外的,不过看了一下源榜,编程的评测确实更强一些,以及Fable 5有的任务一跑就降级,反而拉低了分,实在是没招。
同时呢,这套规则,我也完全的公开出来了,在AIHOT中有一个规则页,大家如果感兴趣的话,可以自己去看。
网址在此:https://aihot.virxact.com/admin/leaderboard/rules
当然最后我想说,我们做的这套东西,它一定也不是百分百的标准,它更不能定义每一个模型真正的能力的边界和参数。
我只能说,用这种方式,尽可能的在我的理解里,在我的能力的范围里面,尽可能公平的把它们汇总起来,给大家一个可能会更加客观的答案。
所以所有的一切数据,我们都暴露在了网页之上,大家全部都可以进行查看或者玩一玩。
当然这还只是第一版,后面我肯定还会继续去做一些优化的,再补上一些更好、更加客观、更加多样化的评测来源,让我们这个榜单也更加的客观一些。
最后也希望这个小小的功能。
能对大家有用。
玩的开心~
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~谢谢你看我的文章,我们,下次再见。
>/ 作者:卡兹克
>/ 投稿或爆料,请联系邮箱:[email protected]