AI+法律数据基础设施

法律数据集
智能法律引擎

朗慧科技深耕法律AI数据服务,构建涵盖裁判文书、法律法规、合同审查、法律问答、司法推理五大领域的18个高质量标注数据集,覆盖500万+裁判文书、200万+法律题库、150万+法律QA对,为法律大模型训练提供合规、专业、高质量语料。

18
高质量数据集
500万+
裁判文书
200万+
法律题库
150万+
法律QA对
legal-ai-training.py
import langhuiai as lh

# 加载中国裁判文书数据集
judgment = lh.legal.load_dataset(
  'china-judgment-documents',
  court_level='最高法/高法/中法',
  samples=5000000
)

# 加载法律法规库
law = lh.legal.load_law_library(
  type='宪法/法律/行政法规/地方性法规',
  hierarchical='层级标注'
)

# 加载合同审查数据
contract = lh.legal.load_contracts(
  task='风险条款识别/合规审查',
  annotated=300000
)

# 加载法律QA对
qa = lh.legal.load_qa_pairs(
  citations='法条引用'
)

print("✅ 法律AI训练数据加载完成")
AI+法律前沿进展

2025-2026 法律AI突破性进展

从GPT-4法律推理到AI法官辅助,从合同智能审查到法律检索大模型,AI正重塑法律服务与司法体系

§
第一条
Harvard 2025

GPT-4法律推理研究

哈佛大学最新研究显示GPT-4在法律推理任务上达律师水平,多项基准测试准确率超85%,在LSAT、Bar Exam等法律考试中表现接近顶尖法学院毕业生,引发法律教育范式变革。

准确率 85%+ · 律师水平
§
第二条
最高法 2025

AI法官辅助系统

中国最高法推进"数助办案"工程,AI辅助裁判文书生成、类案推送、量刑参考,已覆盖全国3500+法院。2025年数据显示AI辅助提升法官办案效率40%,类案推送准确率92%。

3500+法院 · 效率提升40%
§
第三条
ACL 2025

法律大模型LawGPT

基于百万级法律语料训练的LawGPT模型,支持法律问答、文书生成、案例检索、量刑预测等任务。ACL 2025最佳论文提名,在法律推理基准LegalBench上全面超越GPT-4。

百万级语料 · LegalBench SOTA
§
第四条
Stanford 2026

合同智能审查AI

斯坦福发布的合同审查AI在风险条款识别上准确率达96%,超越资深律师平均水平。已应用于大型企业合同审核流程,单份合同审查时间从4小时缩短至5分钟。

准确率 96% · 效率提升48倍
§
第五条
SIGIR 2025

法律检索大模型

基于 dense retrieval + LLM 的法律检索系统,在亿级裁判文书中检索准确率超90%。SIGIR 2025论文提出法律检索专用大模型LegalRetriever,在复杂法律问题上超越传统关键词检索。

亿级文书 · 准确率 90%+
§
第六条
EU AI Act 2026

多语言法律AI

欧盟推进多语言法律AI系统,支持24种官方语言的法律文本理解与翻译。EU AI Act 2026对高风险AI系统在法律领域的应用设立严格合规要求,推动透明可解释的法律AI发展。

24种语言 · 合规可解释
朗慧法律数据布局

长沙朗慧科技法律AI数据战略

深耕裁判文书、法律法规、合同审查、法律问答、司法推理五大领域,构建从专业标注到合规交付的全链路法律数据基础设施

裁判文书数据产品

覆盖最高法、高法、中法多层级裁判文书,含案件类型、判决结果、法律依据等结构化标注。

500万+ 裁判文书

法律法规数据产品

宪法、法律、行政法规、地方性法规全层级法规库,含效力层级、修订历史、引用关系标注。

80万+ 法规条文

合同审查数据产品

买卖、租赁、劳动、股权转让等多类型合同,含风险条款、合规性、异常条款标注。

30万+ 合同样本

法律问答数据产品

法律咨询、考试题库、司法解释问答,含法条引用、案例关联、解答逻辑链标注。

150万+ QA对

法律文本标注体系

实体识别、关系抽取、事件抽取、法条引用、判决结果等结构化标注,支持法律NLP全场景

法律专家审核网络

联合执业律师、法学教授、资深法官构建专家审核团队,确保法律标注的专业性与权威性

全链路合规授权

严格遵循《数据安全法》《个人信息保护法》,所有数据脱敏处理,提供合规授权交付方案

AI辅助标注平台

自研法律AI辅助标注平台,支持自动抽取、智能分类、法条关联,标注效率提升10倍

法律数据集矩阵

18个核心数据集 · 覆盖五大法律领域

聚焦裁判文书、法律法规、合同审查、法律问答、司法推理五大领域,构建法律AI训练数据底座

全部 · 18
裁判文书 · 4
法律法规 · 3
合同审查 · 4
法律问答 · 4
司法推理 · 3
裁判文书

中国裁判文书数据集

覆盖民事、刑事、行政、执行多案由,含法院层级、判决结果、法律依据等元数据标注。

500万份 JSON+元数据
裁判文书

法律案例摘要数据集

裁判文书摘要与要点提炼,含案件事实、争议焦点、裁判要旨等结构化摘要标注。

100万份 摘要标注
裁判文书

量刑参考数据集

刑事案件量刑数据,含罪名、情节、量刑幅度、量刑均衡性等标注,支撑量刑辅助AI。

50万案例 量刑标注
裁判文书

执行案件数据集

法院执行案件数据,含被执行人、执行标的、执行结果、失信信息等标注。

80万案例 执行标注
法律法规

法律法规库数据集

宪法、法律、行政法规、地方性法规、部门规章全层级法规库,含效力层级、修订历史标注。

80万条 结构化+层级
法律法规

法条引用关系数据集

法律条文间的引用、修改、废止关系图谱,支持法律溯源与影响分析。

20万关系 知识图谱
多语言

多语言法律语料库

中、英、日、韩等多语言法律文本对照语料,支持跨语言法律检索与翻译。

40万份 中/英/日/韩
合同审查

合同审查数据集

买卖、租赁、劳动、股权转让等多类型合同,含风险条款、合规性、异常条款标注。

30万份 风险标注
合同审查

起诉状答辩状数据集

法律起诉状、答辩状等诉讼文书,含诉讼请求、事实理由、法律依据标注。

55万份 文本+PDF
合同审查

合同模板数据集

各类标准合同模板,含条款结构、风险点、必备条款标注,支持合同生成AI训练。

5万模板 条款标注
合同审查

合同风险识别数据集

含风险条款标注的合同数据,支持违约责任、不公平条款、合规风险等自动识别。

10万份 风险分级
法律问答

法律问答QA数据集

法律咨询问答对,含问题分类、法条引用、案例关联、解答逻辑链标注。

150万对 Q&A+引用
法律问答

法律题库(海洋法系)

海洋法系法律考试题库,含题目、答案、解析、法条引用,覆盖英美法核心领域。

200万份 文本
法律问答

法律咨询对话数据集

律师-客户多轮对话数据,含意图识别、情感分析、法律建议标注。

20万对话 多轮对话
法律问答

法律实体识别数据集

法律文本中的人名、机构、地名、法条、罪名等实体标注,BIO格式,支持法律NLP。

50万条 NER+BIO
司法推理

司法推理数据集

含推理链标注的司法案例,从事实认定到法律适用的完整推理过程,支持法律推理大模型。

20万案例 推理链标注
司法推理

法律知识图谱数据集

法条、案例、罪名、当事人等法律实体关系图谱,支持法律知识问答与推理。

500万三元组 知识图谱
司法推理

司法预测数据集

案件结果预测数据,含案情特征、判决结果、上诉结果标注,支持司法结果预测AI。

30万案例 结果预测
数据样例

法律数据标注格式

展示裁判文书、法律法规、合同审查、法律问答四类数据的JSON标注结构

裁判文书
法律法规
合同审查
法律问答
judgment-annotation.json
应用场景

AI+法律典型应用

基于朗慧法律数据集的六大典型AI应用场景

智能法律问答

基于法律QA数据训练的法律大模型,提供7×24小时智能法律咨询服务,准确率超90%。

裁判文书分析

AI自动分析裁判文书,提取案件要素、判决结果、法律依据,支持类案检索与量刑参考。

合同智能审查

AI自动审查合同风险条款,识别违约责任、不公平条款,审查效率提升48倍。

法律检索

基于dense retrieval的法律检索系统,在亿级裁判文书中检索准确率超90%。

司法预测

基于案件特征预测判决结果、上诉成功率,为律师诉讼策略提供数据支撑。

合规风险检测

AI检测企业合规风险,自动识别法律合规问题,降低企业法律风险。

常见问题

FAQ

关于法律数据集的常见问题解答

法律数据集覆盖哪些内容?

朗慧法律数据集涵盖裁判文书、法律法规、合同审查、法律问答、司法推理五大领域,18个核心数据集。包括中国裁判文书(500万份)、法律案例摘要、量刑参考、执行案件、法律法规库(80万条)、法条引用关系、多语言法律语料、合同审查(30万份)、起诉状答辩状、合同模板、合同风险识别、法律问答QA(150万对)、法律题库(200万份)、法律咨询对话、法律实体识别、司法推理、法律知识图谱、司法预测等,总计覆盖500万+裁判文书、200万+法律题库、150万+法律QA对。

数据合规性如何保障?

严格遵循《数据安全法》《个人信息保护法》《网络安全法》等相关法律法规。所有涉及个人隐私的数据均经过脱敏处理(姓名、身份证号、地址等),裁判文书数据来源于公开渠道并已获授权使用。提供完整的合规授权链路,支持企业级合规交付方案,确保数据使用的合法合规性。

数据适用于哪些AI应用场景?

适用于智能法律问答、裁判文书分析、合同智能审查、法律检索、司法预测、合规风险检测等六大典型场景。支撑法律大模型(LawGPT)的训练与微调,为法院、律所、企业法务、法律科技公司提供专业AI训练数据,已服务多家法律机构。

数据质量如何保证?

采用"法律专家+AI辅助"双重质控体系。联合执业律师、法学教授、资深法官对标注内容进行专业审核;自研AI辅助标注平台进行格式校验、一致性检查等自动化质检。法律实体识别准确率超92%,法条引用准确率超95%,确保数据的专业性与权威性。

支持哪些数据交付格式?

支持文本格式(TXT/DOCX/PDF)、结构化格式(JSON/XML/CSV)、标注格式(BIO/JSONL/COCO)、知识图谱格式(RDF/OWL/N-Triples)等多种交付方式。同时提供数据字典、标注规范文档、法律实体对照表等配套资源,支持API接入与定制化交付。

商务合作

构建智能法律新生态
共筑AI法律数据基础设施

联系朗慧数据专家,获取完整法律数据集目录、试用权限及定制化解决方案

18
核心数据集
500万+
裁判文书
150万+
法律QA对