OpenAI 发布了面向法律垂直领域的 Astra for Law,目标客户是律师与法务软件公司。它在通用网页检索之外接入了 CourtListener 判例库,该库覆盖 99.9% 以上已公开的美国判例法。效果体现在一道简单的对比上:私有验证集正确率 54.0%,比仅使用网页搜索的 GPT-6 Astra 高出超过 15 个百分点。
一、Astra for Law 到底是什么
Astra for Law 不是一个重新训练的法律大模型,而是「通用模型加权威垂直语料」的组合产品:底座仍是通用推理能力,检索层则被替换成法律专业来源。它对外的服务对象有两类,一类是律师个人与律所,另一类是把法务能力嵌进自己产品的软件公司,后者可以通过接口把这套检索与生成能力集成到既有工作流里。
1. 通用检索为什么在法律场景不够用
通用网页搜索返回的是「说得通的内容」,而法律工作需要的是「可引用的依据」。判例、法条、法院层级、裁判时间这些要素一旦缺失,答案即使措辞严谨也可能是错的。通用模型在法律问题上常见的失效模式,恰恰不是语言不流畅,而是引用了不存在或已被推翻的判例。
2. 权威语料库为什么是关键变量
把检索范围限定在权威判例库,等于把答案空间从「整个互联网」收窄到「可核验的法律来源」。这既提高了准确率,也让每一条结论都能回溯到具体案号,便于人工复核。对受监管行业而言,可回溯性本身就是一个硬性要求。
二、2.3 亿 URL 与 99.9% 覆盖率:两层语料怎么配合
| 语料组成 | 规模 | 承担的角色 |
|---|---|---|
| 网页索引 | 2.3 亿 URL | 覆盖行业动态、法规解读等通用背景信息 |
| 判例库 CourtListener | 覆盖 99.9% 以上已发布美国判例法 | 提供可回溯、可引用的权威判例依据 |
| 私有验证集表现 | 正确率 54.0% | 高出仅用网页搜索的 GPT-6 Astra 超 15 个百分点 |
数据来源:以上数据出自 OpenAI 发布信息,经 AIbase 报道转述。
三、54.0% 这个数字该怎么读
它同时说明了两件事。往上看,超过 15 个百分点的提升证明垂直语料的真实价值:同一套推理能力,喂判例和喂网页,差距就摆在那里。往下看,54% 意味着接近一半的问题仍然答错,这个水平远没到可以独立出具法律意见的程度。
1. 十五个百分点从哪里来
增量主要来自检索层而非生成层。判例库把候选答案的范围收窄到专业来源,减少了模型「自己编一个看起来合理的判例」的空间;同时案号、法院层级等结构化元数据让排序和筛选更可靠。
2. 上限为什么仍然明显
法律任务的难点不只是找到判例,还包括判断类比是否成立、 jurisdictions 是否适用、案件事实是否可区分,这些都属于推理与判断,检索层帮不上忙。再加上验证集本身往往刻意选取高难度问题,54% 更像是困难模式下的成绩,而非日常简单检索的表现。
四、谁该用,以及怎么用才不出事
现阶段最合理的定位是「检索与草稿辅助工具」,而不是终局意见来源。适合它的用法是:用它快速定位候选判例、生成检索报告初稿、梳理争议焦点;不适合它的用法是:直接采信结论、跳过人工复核。律所引入时,建议把「每条结论必须附可核验引用」写进使用规范,并对对外交付物保留律师签字环节。对法务软件公司而言,把引用核验做成产品内的强制步骤,往往比单纯追求更高正确率更能降低实际风险。
FAQ:关于 OpenAI Astra for Law 你最可能关心的三个问题
Astra for Law 比通用模型强在哪里?
核心差异在检索层:它索引 2.3 亿 URL,并纳入覆盖 99.9% 以上已发布美国判例法的 CourtListener 案例库。在私有验证集上正确率达 54.0%,比仅使用网页搜索的 GPT-6 Astra 高出超过 15 个百分点。
54% 的正确率能直接用在工作里吗?
可以作为检索与草稿辅助,不宜作为终局结论。接近一半的问题仍会答错,法律场景的容错率极低,建议要求每条结论附带可核验引用,并保留人工复核与律师签字环节。
它面向哪些用户?
主要面向两类:律师与律所,以及希望把法务检索能力嵌入自身产品的法律软件公司,后者可通过接口把检索与生成能力集成进既有工作流。
小结
Astra for Law 的意义,在于用一个可量化的对比证明了垂直语料的价值——同样的模型底座,换个检索来源就能拉开 15 个百分点以上。但它也诚实暴露了上限:54.0% 的正确率提醒所有人,法律 AI 目前的位置是「高效的助理」,而不是「可替代的判断者」。真正决定它能否落地的,不是模型再提升几个点,而是机构能否建立起强制复核与引用核验的使用规范。
消息来自 HEX2077 AI资讯日报(2026年9月19日),原始出处 https://www.aibase.com/zh/news/31146
