pythonic生物人

北大团队ChatLaw,法律普惠大众!

开一个新专栏,不定期分享有趣、有用的AI知识:AI泡沫?

Image

  第一时间获取干货
「pythonic生物人」群👉
加入

本次分享ChatLaw。

近日,北大团队发布法律大模型 ChatLaw,为大众提供普惠法律服务!

Image


ChatLaw简介

  • 为了促进LLM在法律甚至其他垂直应用落地的开放研究,本项目开源了中文法律大模型,并针对LLM和知识库的结合问题给出了法律场景下合理的解决方案。

  • ChatLaw法律大模型目前开源的仅供学术参考的版本底座为姜子牙-13B、Anima-33B,我们使用大量法律新闻、法律论坛、法条、司法解释、法律咨询、法考题、判决文书等原始文本来构造对话数据。

  • 基于姜子牙-13B的模型是第一版模型,得益于姜子牙的优秀中文能力和我们对数据清洗、数据增强过程的严格要求,我们在逻辑简单的法律任务上表现优异,但涉及到复杂逻辑的法律推理任务时往往表现不佳。

  • ChatLaw框架

Image
https://arxiv.org/pdf/2306.16092.pdf

大型语言模型简介

大型语言模型(Large Language Models,LLMs)指具有数十亿参数(B+)的预训练语言模型(eg:GPT-3,LLaMA),参数基于大量文本数据训练,现有大型语言模型主要采用 Transformer 模型架构,且在很大程度上扩展了模型大小、预训练数据和总计算量。

LLMs可以用于各种自然语言处理任务,如文本分类和情感分析、智能客服、文章/故事诗歌等创作、机器翻译等等。下图是近几年出现的各种大型语言模型时间轴(2019 年以来、百亿+参数),其中标黄的大模型已开源。

Image
https://arxiv.org/pdf/2303.18223.pdf

  • 进一步学习
论文地址:https://arxiv.org/pdf/2306.16092.pdf
官网地址:https://www.chatlaw.cloud/
模型开源地址:https://github.com/PKU-YuanGroup/ChatLaw

-END-

Image

  第一时间获取干货
「pythonic生物人」群👉
加入

-推荐阅读-
如何学Matplotlib+ggplot2 ?
详解Python CONDA
天天在用的P值到底是个啥?
pythonic生物人去哪了?
《ggplot2: Elegant.....》中文版
最有价值50图表(Python代码)
Jupyter Notebook的16个插件!