活动预告|AI+法律:法律是大模型天然契合的行业,场景落地案例渐增
SOTA AI Devs Park 是专注于生成式 AI 领域的公益开发者社区,由生成式 AI 产业加速营 SOTA AI 支持建设,正在策划举办系列 Meetup 与闭门会,聚焦于同频交流生成式 AI 的前沿趋势与一线技术实践。
#1.
法律作为一个保守、精英的行业,在历史上对于技术的采纳向来比较慢。但在这次大模型引爆的AI革命中,却更早地受到了“冲击”,从而不得不主动或被动地开始拥抱AI技术。
AI带来行业冲击
今年3月,OpenAI发布GPT-4,随后美国伊利诺伊理工大学-芝加哥肯特法学院便在其官网发布消息,称GPT-4通过了美国律师资格考试,并且在成绩排名上超过了90%的考生。值得一提的是,GPT-4上一代模型GPT-3.5参加该考试的成绩还是倒数10%——AI能力进化的如此之快,不禁令很多人感到担忧,在不远的未来很多人会因此失业。
法律行业加快拥抱AI技术
#2.
这两点核心变化有可能成为这次与上次AI最大的变量,是未来的发展超越之前的线性预测。
#3.
AI在法律领域引发了这么多“大新闻”和投融资,对创业者和投资人比较关键的一个基本问题是:AI+法律的市场究竟多大?未来的市场格局会如何?
虽然AI与法律的结合早已有尝试,但在这次AI技术变革之前,AI在法律领域能够解决的问题还是比较受限,因而也并没有形成成规模的赛道,AI+法律的市场规模尚无成熟的数据可以借鉴。不过我们可以从两个角度,对AI+法律的市场规模和格局进行一下推测。
结合全球法律服务整体市场规模,从替代人力的角度推算
全球法律服务市场规模近年来稳步扩大。据Statista数据,2015-2020年,全球法律服务市场以接近3.4%的年均增速扩张,到2021年,全球法律服务市场接近7400亿美元。按此增长率预估,到2030年,全球法律市场将成长到万亿美金市场规模。做个简单的推算,理想情况下,如果AI能够以1/10的价格去服务20%的市场,那么对应的是个几百亿美金的市场。相对于人工服务,AI工具的好处在于,边际成本极低,更容易规模化,也更容易生长出巨头。
法律科技领域公司的现状
前面只是理论推导,真正的市场规模也要结合现实,我们可以通过整个法律科技领域公司的发展情况,来推测AI+法律市场未来的一些发展走向。
法律科技领域,在2021年之前,市场上仅有DocuSign公司于2018年上市;到了2021年,Nuix、LegalZoom、CS Disco、Intapp等四家法律科技公司相继上市,随后Evisort、Ironclad、Elevate等公司也宣布了上市计划。这些公司中,LegalZoom是法律电商平台,Elevate是一家综合性的法律服务提供商,其余6家均为软件公司。
海外法律科技行业的特征及突破点
结合以上具有代表性的龙头公司,可以看出目前海外法律科技行业存在几个特征:
第一,相比其他科技公司动辄数百亿美元的市值,法律科技公司的规模并不大。其核心原因在于法律行业的技术渗透率和在线化率都较低。前文提到过,历史上,法律行业一直属于对于技术采纳非常慢的行业。对此,LegalZoom曾提到:“虽然会计、税务、营销和支付等服务行业已迅速向在线化转型,但法律服务大多仍处于离线状态。”CS Disco也有类似说法:“法律行业在数字化和云技术应用方面落后于其他行业。我们认为,现代技术解决方案的渗透性明显不足。”据LegalZoom的调查数据显示:法律行业的在线率只有8%,远远低于医疗、金融等行业的水平。
第二,目前法律科技最大的赛道集中于合同数字化,相关的创业公司超过了法律科技公司总数的1/3。
第三,企业为最终付费方。法律服务虽然是一个大市场,但是其中大多数细分赛道的规模都较小。很多创业企业之所以达不到IPO的门槛,是因为它们面向的客户仅限于律所或公司法务部。CS Disco提到:“不管我们与谁签约,最终的付款人几乎都是公司法律部,律师事务所和服务提供商会将我们的账单转交给他们的客户进行报销。”Law.com的观点则更加激进:“成功IPO的关键要面向整个企业,而不仅仅是法律相关的员工。”
其中第一和第三个问题,是这一轮新的AI+法律创业公司仍然需要面对的市场现实。如果不能打破渗透率低、分散的市场现状,那么新一轮创业公司仍将难以突破规模的天花板。值得期待的是,我们看到这轮AI技术的“爆发性”在于,一旦某个技术/解决方案的效果超出了一定“阈值”,会带来巨大的流量和使用率的快速上涨(如ChatGPT在对话效果上超过了用户体验的阈值,从而带来快速增长)。
#4.
2B:针对企业提供法律科技服务。一般是针对企业中高频、重复的法律需求提供解决方案(例如,针对房产中介平台提供的合同智能处理服务)。 2L:针对律所/律师等法律专业从业者的法律科技服务。严格来说,2L也是2B的一种,可以算作是2B里面一个特殊分类。根据过往的行业经验,2L的公司会碰到天花板较低的问题。与LLM结合之后的“AI法律助理”是否能够突破这一限制,仍需要时间观察。但我们观察到,最近半年在海外拿到高额融资的头部AI+法律创业公司,多集中于这个领域。 2C:针对普通用户提供的法律科技服务平台,为用户提供法律问题的自动解答、相关律师推荐等。由于普通用户的使用频次低,决策流程长等问题,2C平台扮演的更多是为律所/律师引流的角色,产品的价值和天花板不高,很难形成独立的产品,更多是依附在2B平台上的一个附加服务——许多2B的产品会搭建类似平台帮助其客户做引流。
Evenup
网站:https://www.evenuplaw.com
EvenUp创立于2019年,旨在利用AI帮助律师进行案件索赔工作,主要聚焦于个人伤害索赔(Personal Injury Claims)领域(该领域每年受害者的索赔金额达1000 亿美金),其中AI主要用来审查各种医疗文件、案件档案来生成医疗摘要以及损害估计。
创始团队
创始人Rami Karabibar之前在贝恩咨询以及Waymo等公司工作、另外两位联合创始人Raymond Mieszaniec和Saam Mashhad分别在咨询和法律行业有过多年工作经验。
融资情况
2020年至2023年4月共获得3轮融资,投资方包括BVP、Bain Capital等知名机构,最新一轮估值3.5亿美金。
产品及业务情况
EvenUp的产品让整个索赔流程变得非常简单,用户只需上传原告信息,EvenUp会自动从医疗记录中调出所有相关的伤害、程序及治疗日期,并整合这些信息为用户写一份完整的报告,其中包含损失明细、伤害明细以及处理的详细信息,它会对每个损失进行可靠的评估。
Evenup的ARR只用了1年时间便达到170万美元(2022年)并预计在2023年达到890万美元。据其官网公布的数据,目前通过Evenup每月会生成1000+需求文件稿,有200+律所客户在使用其产品,按照2023年890万ARR估算,平均每个客户一年为其支付2万+美元,帮助客户索赔金额达5亿美金。
优势及壁垒
EvenUp的AI模型的训练数据全部来自行业专家,包括辩护律师、经济学家和技术专家准备的成千上万的请求,利用了超过25万个公共裁决和私人和解来提高其分析的准确性。
CoCounsel是AI法律公司Casetext 推出的一款基于OpenAI GPT大模型的AI法律助理 ,可以用于法律研究、文件审查和合同分析、回答自然语言问题等。
创始团队
CoCounsel不是一个独立公司,而是由其母公司Casetext孵化的新业务。Casetext的创始人Jake Heller毕业于斯坦福大学法学院,曾任Ropes & Gray律所的诉讼律师。
融资情况
自2013年成立以来,共进行了7轮融资,总计融资金额为6430万美元,投资方包括YC,USV等知名机构。2023年6月,Casetext以6.5亿美元估值被汤森路透全资收购。
产品及业务情况
CoCounsel可以帮助律师做以下工作:审查文件/数据库;进行作证准备;自动撰写法律研究备忘录;提取合同数据,进行合同的合规性检测等。优势及壁垒
与OpenAI合作:OpenAI与Casetext合作进行了数月的深入、严格的工作,以构建适合(可靠且安全)供法律专业人士使用的版本。
基于专业数据的微调:Casetext将GPT技术与其专有法律数据库和法律搜索系统ParallelSearch相结合,目前已经使用超过3万个法律问题对 CoCounsel 进行训练。
安全&隐私:CoCounsel 使用专用服务器访问 GPT-4。客户的数据不会作为可公开访问的知识的一部分发送来“训练”模型。客户的信息保持私密,并通过银行级 AES-256 加密保护。
与汤森路透的合作:汤森路透的并购将给CoCounsel带来更大的数据优势,关于这个并购案,后文将有更详细的分析。
Lexis+AI™
网站:https://www.lexisnexis.com/en-us/products/lexis-plus.page
融资情况
产品及业务情况
优势及壁垒
海量数据:律商联讯拥有全球最大、最权威的法律数据。其拥有的专业数据量高达2500TB,是维基百科总容量的150倍。
Robin.AI
融资情况
产品及业务情况
优势及壁垒
Spellbook (前身为Rally)
网站:https://www.spellbook.legal/
Spellbook开发了第一个生成式人工智能合同起草工具。该技术由OpenAI的GPT-4等大型语言模型提供支持,针对利用法律数据集的合同性能进行了优化。
创始团队
创始人Scott Stevenson是技术背景出身,曾创立Munemusic, 并在NOCland担任工程总监。
融资情况
2019年至2023年5月共获得2轮融资,总计融资近1200万美元,估值未知。
产品及业务情况
Spellbook使用OpenAI 的GPT-4来帮助法律从业者起草和审查合同。功能包含缺失条款审查、定向草案和查找冲突条款等。此外,Spellbook也为法律团队提供其他技术支持的解决方案,如客户接收、协作和公司管理等功能。据官方数据称目前有600+法律团队正在使用其平台。另有53,000人注册了候补名单。
优势及壁垒
专业数据微调:Spellbook是唯一一个受过合同领域微调,并与Word整合的基于GPT4的工具。Spellbook 接受过案例数据库、表格库和法规的培训。可以全面分析整个合同和文件,且不会遇到token限制。
Lexion
创始团队
融资情况
2019年至2023年4月共获得3轮融资,投资方包括Madrona、Khosla Ventures等知名投资机构,3轮总计融资3520万美元,估值未知。
产品及业务情况
优势及壁垒
#5.
以上项目主要集中于美国市场,对于聚焦国内的创业者来说,在借鉴海外创新思路的同时,也应注意中美法律服务市场的差异。我们与业内人士进行了访谈,认为有几点主要差异:
美国与中国法律体系的差异。美国是判例法体系为主,而中国是成文法体系为主。判例法是由法官在司法审判过程中创造出的法律,其形式是判例,而成文法是由立法机关通过立法程序制定的法律,其形式是立法机关的制定法(statutes)或委托行政机关进行的立法。因而在美国司法体系中,在判案时要依据大量的过往判例情况进行裁量;而在中国,判案时主要依据法律条文,过往判例只起到辅助作用。两国法律体系的根本性差异会带来对于大模型应用落地的一系列差异,例如,在判例法体系下对于判例数据的依赖性更大,这些数据能够带来的竞争壁垒也更高。
美国律师行业的人力成本更高,对于采用AI替代人工来降本增效更有动力,在付费意愿与付费能力上都明显好于国内。
美国人更习惯打官司。处理大大小小的事情(如事故、离婚等),找律师是他们常用的一个手段。民事诉讼方面,人均比例应该比中国高很多。
2G是国内企业可以关注的一个特色。在中国,智慧化政府是个大趋势,而法律科技也是该方向基建的一个重要部分,政府层面有相关预算。据我们了解,基层法院工作量大,急需技术解决方案提升人效,加之有相关预算支撑,法院对相关产品及服务的付费意愿较强,这是当前盈利的重要点。
#6.
在这个领域创业,我们认为有以下几个挑战需要考虑:
数据隐私/保护。法律涉及的是高度敏感数据,法律文件中包含着非常多商业机密及个人隐私,律所会对其采用的解决方案能否完全保障客户信息的保密性高度重视。即便在律师内部,不同团队之间的信息也不是共享的。因此,我们认为,这个领域的产品/服务会更多以私有化部署的形式提供,同时,提供好的数据隐私保护是必要的前提。
解决大模型的幻觉问题。解决大模型的幻觉问题。法律行业高度严谨,大模型“一本正经的胡说八道”对于有些行业可能还有可取之处(如广告文案、创意行业),而对于法律行业则是一个灾难。最近媒体上热议的纽约律师Steven Schwartz的案子就是个很好的例子,他在准备向法庭提交的陈述书时使用了ChatGPT作为辅助,结果ChatGPT杜撰了6个根本不存在的案件和裁决,闹了个大笑话,该律师也因此而被法院定罪。由此可知,大模型与法律行业结合必须要解决好大模型的幻觉问题——需要调整让大模型严格基于现有的法条与案例输出,达到相当的精准度,而不能“自由发挥”。
产品的切入点和发展路径。如前文提到,法律行业本身对新技术是趋于保守,而客户包括企业、律所、法院、普通用户等多种,如何在市场空间、对技术的精准要求和满足客户的流程/功能需求之间把握平衡,找到一个好的切入点获取种子客户验证产品快速迭代,至关重要。同时,鉴于法律科技市场的天花板问题,在切入之后,如何横向或纵向发展,做大业务,也是个很大的挑战。
那么,这个赛道的壁垒是哪些呢?
专业数据/行业know-how的获取。法律行业数据高度敏感、不公开,是否能获取到这些专业数据成为了创业公司最重要的壁垒之一。前文我们介绍的创业公司,很多是通过与头部律所形成战略合作来获得独家的专业数据以及行业know-how。也有公司自己原本的业务就是法律数据库,具备天然的数据优势。专业数据和know-how对纯技术团队来说是比较大的难点,这也是为什么很大该领域的明星项目都有具备深厚法律背景的创始人或联创。
产品化的能力。将大模型技术与行业经验深度结合后输出让客户满意的产品,是垂直领域做AI项目的核心能力之一。对于法律行业,做好“产品化”有一定难度。举个最简单的例子:比如用AI审核合同,审核“精准度”的把握就很有学问。如果精准度定的太高,AI把所有的“问题”都标出来,不仅不能提高效率,还会让律师浪费很多不必要的时间在不重要的问题上。如何能够把重要的问题找出来、没有遗漏,又能放掉那些不重要的问题,这是非常有挑战性的,需要结合行业经验训练和调整,也是团队之间能够拉开差距的地方。
获取头部标杆客户的能力。我们看到,海外新成立的这些AI+法律公司,许多都是在成立初期便与行业头部的律所/客户形成了合作关系,对于该领域的创业公司来说,签约头部客户的意义重大,这不仅意味着在销售上的示范效应,更重要的是获得了独家的行业数据、专家资源,并且产品能够在第一时间得到专业用户的反馈,更快地迭代优化,提升产品力,从而进入业务的正向循环。
在这个赛道的创业公司,我们看到一些共性。这也跟我们分析的挑战和壁垒相契合。
构建行业专属大模型。结合行业数据(法条、案例、专业法律文档等)和专家经验训练的大模型,在输出效果上比通用大模型有显著提升。目前已经有一些开源的法律专业大模型(如北大团队近期发布的ChatLaw中文法律大模型等)。未来创业公司可以选择自己训练行业模型(本文提到的许多创业公司都选择了自己训练模型),或者基于开源的行业模型提供服务。
复合背景的团队。该领域的创业对法律行业的理解、行业资源以及AI技术能力缺一不可,因而技术+法律的复合背景团队是该领域创业的理想配置,我们也观察到绝大多数该领域拿到融资的创业团队都是这样的组合。
#7.
前几日,汤森路透宣布斥资6.5亿美元收购上文提到的Coconsel的母公司——Casetext,成为近期AI赛道规模最大的并购交易之一(另一个颇具影响力的交易是Databricks以13亿美元估值收购MosaicML)。我们观察到,在AI领域,创新公司与巨头的快速整合似乎正在成为一种趋势。
汤森路透CPO David Wong在回应其投资人为什么要收购Casetext而不是自建AI工具时表示:
“Casetext/CoCounsel的独特之处在于,他们是极少数可以访问数据的公司之一——他们能够访问历史 Casetext 研究数据集,因此他们既受益于早期访问 GPT-4 的好处,也获得了如何将大模型与权威数据集相结合的经验,他们的数据集虽然规模更小,但更为复杂、专业。
我认为这使得他们与市场上其他仅使用LLM的人相比是独一无二的。这意味着他们的团队、专业知识和经验可以更容易地转化为我们的优势,这将会使我们再次成为拥有真正权威数据集、相关人才并真正知道如何生成式AI的少数公司之一。”
而Casetext创始人谈到为什么会选择被汤森路透收购:
“核心原因之一是要解决Casetext目前的头号制约因素——内容。如果Casetext的法律研究能力/CoCounsel法律助手背后有West和Thomson Reuters的世界级内容数据库的支持,将大大提升产品的体验,这对用户会是个直接的好处。另外,使用这些世界级内容数据库我们可以做的更多。”
在这里,一方拥有领先的大模型应用经验和一定的专业数据积累,另一方拥有强大的数据库和雄厚的资本实力,并将AI视为整个公司最重要的战略方向(生成式AI是汤森路透近期最重点战略之一,计划每年花费约1亿美元投资于AI,与此同时还设定了2023-2025在AI领域的并购预算为100亿美元)。
在需要大量数据、资本驱动的AI领域,这样的结合会不会成为一种常态?对于AI领域的创业公司来说,更快地与巨头联姻或者其他形式的深入合作,而非独立成长上市,会不会成为这个领域一个成长路径?这是一个开放性问题,我们将在未来的行业发展中持续追踪。
(以上内容来自合作伙伴Atom Capital:《AI会取代律师吗?大模型在法律领域应用研究》,2023.07.05)
# 活动报名·AI 新场景系列沙龙03
🌲活动:AI+法律行业落地
🔥形式:开放式沙龙/Meetup(免费)
⏰ 时间:2023 年 7 月 30 日下午13:30-18:00
🗺 地点:北京 中关村(具体地址待报名审核通过后,发送邀请)
分享嘉宾:Turing,LegaLNOW,联合创始人
分享主题简介:LLM时代,新生态的法律科技公司更加应该专注于Ai原生的产品,提供高质量的法律服务嘉宾主要分享:为什么选择法律作为应用场景?如何选择及使用LLM? 如何应对LLM幻觉及合规性要求?
🚀 发起社区:AI 实践派 与 SOTA AI 联合发起
🙋♂️ 报名:扫码添加 Dora 微信(id:SotaAI2050),建议备注「AI法律」。
扫码报名
# 往期嘉宾
陈平|四维创智、杨礼显|SmartBI、王文广|达观数据、何成杰|英伟达、张周|彬复资本、任博冰|创新工场ED&前沿科技基金总经理、高振宇|埃睿迪
#AI大模型开发系列:
何成杰(英伟达 资深解决方案架构师) :ChatGPT背后的模型详解
丁峰(前阿里大计算团队/华为/英伟达):GPU结构分析
肖城(前Intel 英特尔深度学习模型优化专家):模型优化之量化
丁峰(前阿里大计算团队/华为/英伟达):Deepspeed详解
#AI新场景系列沙龙:
宁宁(衔远科技 合伙人)《大模型在消费品领域的探索》
任一(奥创光年 VP)《AI如何帮助市场营销带来更确定的增长》
马春原(左手医生 合伙人)《医疗大语言模型的构建与应用》
陈林(行者AI VP)《AIGC赋能游戏产业链》
Ada(Share Creators)《AI赋能游戏资产的管理效率与版权保护》
蒋老师(某国有银行数据分析中心负责人)《银行实施LLM应用项目面对的五个问题》
刘志强(国金证券科技研发部RPA负责人)《LLM赋能证券行业的智能客服、研报、编码》
贾超(面壁智能VP)《面壁智能CPM大模型技术及生态》
* 部分新场景沙龙是SOTA AI与AI实践派联合发起。受行业话题敏感性、嘉宾所在企业PR管理诉求等因素影响,SOTA AI未能将所有活动内容整理发布。
—end—
作者 | Atom Capital
排版|Dora|Sota.AI
审核|瑞恒Ryan
* 点击阅读原文,亦可完成本次活动报名