OpenAI于2026年9月17日发布Astra for Law,将GPT‑6 Astra与美国法律搜索索引、法律分析指令、隐私权限及律所工具集成,试图成为律师事务所和法律科技公司的通用AI底座。它可以检索美国判例、法令、监管文件和法院规则,并把研究结果用于合同审查、诉讼分析、尽职调查和IPO文件起草。OpenAI称,在200道未公开的美国法律研究题上,完整系统的总体正确率为54.0%,高于仅使用网页搜索的GPT‑6 Astra的38.7%,相对提升约40%。不过,这不是准确率接近百分之百的“AI律师”,也没有证据表明其基础模型权重经过单独法律训练;成绩来自OpenAI对私有验证集的测试,尚未独立复现,而且主要覆盖美国法律。其真正意义在于表明前沿模型的竞争正从单纯比拼模型能力,转向专业数据库、权限体系、工作流和行业分发入口的整合。
文章作者、来源:OpenAI
它不是简单地让GPT‑6多背一些法律知识
Astra for Law被OpenAI称为“法律工作的全新基础”,但从公开的技术说明看,公司没有宣布为它单独预训练一套法律大模型。
其核心仍然是GPT‑6 Astra,外面增加了四层专业能力:法律搜索索引、针对法律研究和写作设计的指令、律所数据与软件连接工具,以及处理客户机密所需的权限和治理机制。它将在产品中显示为“GPT‑6 Astra Law”,API名称则是gpt-6-astra-law。
这种区别非常重要。一般大模型可能知道著名案件,却不一定能找到最新判决、判断判例是否具有约束力,或发现某个裁判已经被上级法院推翻。律师需要的也不是一段听起来合理的法律常识,而是能够检查的案号、原文段落、法院层级和适用范围。
因此,Astra for Law的主要提升并不完全来自模型“变聪明”,而是来自给模型配置了更适合法律工作的资料和工具。
法律索引覆盖超过2.3亿个网址
Astra for Law可以检索美国判例法、成文法、行政法规、法院规则和行政决定,索引规模超过2.3亿个网址,并会每日加入新来源。
其中一个重要数据合作方是非营利机构Free Law Project。其CourtListener项目收录了超过99.9%的已公开美国先例判决。Astra可以先寻找与客户事实最接近的案件,再定位有关段落,判断判决来自哪个法院、对当前案件是否具有约束力,以及是否存在对己方论点不利的案例。
不过,这不代表它拥有美国全部法律资料。未公开文件、受保密令限制的材料、律所内部文件以及部分商业数据库内容,并不会因为接入CourtListener自动出现。OpenAI把该索引描述为对Thomson Reuters等授权内容和专业法律产品的补充,而不是替代。
它目前公开强调的也是美国法律研究能力,不能把相同成绩直接外推到中国、欧盟或其他法域。
54%的正确率意味着什么
OpenAI使用Vals AI法律研究基准的一组私有验证题进行了测试。题目共200道,要求系统寻找相关权威资料和关键段落,并按照律师制定的标准完成研究答案。
在双方都使用最高推理强度时,完整的Astra for Law有54.0%的题目通过总体正确性检查;仅使用普通网页搜索的GPT‑6 Astra为38.7%。这是15.3个百分点的绝对提升,或者约40%的相对提升。
在以判例为主的问题上,法律版系统找到的参考案件多24%;在人工审计的目标段落中,它从正确法院判决里检索到的相关段落最多增加54%。
但54%同时说明,完整系统仍有接近一半的问题没有通过总体正确性检查。这不是可以省略律师复核的可靠性水平。
评测还有几项限制:200道题来自未公开验证集,外界无法检查题目是否具有代表性;数据由OpenAI公布,尚无独立机构复现;比较对象是同一模型使用普通网页搜索,而不是所有现有法律AI产品。Vals的公开排行榜目前还将通用GPT‑6 Astra列为Legal Research Bench的第20名,而Astra for Law的54%来自另一组私有验证题,两组结果不能直接混为一谈。
一条错误判例,足以让整份法律意见失去价值
OpenAI在原文中提供了诉讼和交易领域的对照案例。
其中一道题要求模型寻找与商业误导最接近的判例:一家公司在签署五年合约前,被告知同类供应商过去每年平均获得约800万美元订单;合同却只保证每年200万美元,额外订单由零售商决定,最后实际订单仅略高于最低额。
OpenAI称,Astra for Law找到了事实结构更接近的案件,并准确区分了“对未来订单的预测”和“对过去平均业绩的事实陈述”。相比之下,Claude Fable 5.1引用的案件判决后来已在上诉中被推翻。
这个例子说明法律检索的难点并不是生成一份文风像律师的备忘录。模型必须找到真正存在、仍然有效、事实相近并适用于目标法域的权威材料。一项引用错误可能让后续分析写得再流畅也失去基础。
但它仍只是官方挑选的个别示例,不能替代大规模独立测试。
OpenAI想进入的不是搜索框,而是整套法律工作流程
法律研究只是第一步。OpenAI为Astra for Law加入了分析和写作指令,让它能够结合客户事实形成论点、起草交易条款、寻找己方立场的弱点,并说明合同例外条款如何改变风险分配。
公司同时与多家美国大型律所开发定制系统。
Sullivan & Cromwell建立了协议分析器,把律所的谈判规则和既有文件带入新合同审查,寻找只有把多个条款放在一起才会显现的风险,再生成修改建议和客户意见草稿。
Ropes & Gray开发了交易尽职调查系统,用于检查数据室文件、追踪结论来源,并标记可能影响收购的事项,例如关键客户合同是否要求提前通知或取得同意。
Cooley的GO Public则面向IPO准备工作,帮助起草上市申请、识别需要管理层注意的风险,并在交易条件变化后,把影响同步到不同文件中。
这些系统的共同模式不是“AI给出最终法律答案”,而是先完成检索、归纳和初稿,把律师的时间集中到判断、谈判策略、责任承担和客户沟通上。
26个插件让OpenAI直接进入律所的软件栈
Astra for Law首批连接了26个合作伙伴插件。律师可以把ChatGPT生成的谈判简报保存进iManage案件档案;Intapp能够找出可能需要补记工时的活动;DeepJudge可以调取律所以往交易进行比较;Thomson Reuters则会把HighQ中的案件背景接入ChatGPT,并计划推出CoCounsel Legal连接器。
此次发布还包括法律工程师开发的9个社区插件和47项可修改技能。ChatGPT for Word也同时全面开放,用于校对、提出修改建议和检查法律文档的格式问题。
Harvey和Legora等法律AI公司将能够通过API使用Astra for Law。OpenAI强调,希望这些公司继续围绕自己的产品和专业知识开发,而不是由ChatGPT取代整个法律软件市场。
不过,OpenAI现在同时提供底层模型、搜索索引、ChatGPT工作界面和律所定制工程,已经深入了原本由法律AI创业公司和专业数据库供应商占据的价值链。所谓“开放生态”是否会长期保持平衡,仍要观察合作伙伴对OpenAI基础设施的依赖程度。
客户机密是比模型分数更难解决的问题
律师事务所处理的材料可能受到律师—客户保密特权、法院命令、交易保密义务和内部利益冲突规则约束。因此,法律AI不只要回答正确,还必须确保只有被授权的人可以接触相关数据。
OpenAI为符合条件的律所建立了Trusted Access Program。API可提供零数据留存,ChatGPT Enterprise中的使用默认不进入人工审查。公司还与Latham & Watkins合作设计信息权限、道德隔离墙、客户指示和律所监督机制。
“零数据留存”并不代表AI系统不处理材料,而是服务完成请求后不保留相应内容。律所仍需要检查连接器会读取哪些文件、权限是否继承正确、生成内容保存到哪里,以及审计日志由谁掌握。
初期版本只向选定律所提供,可在ChatGPT和Codex中使用;API尚未全面开放,OpenAI只表示即将推出。价格、推理成本、延迟和普通律所的开放时间也没有公布。
这次发布展示了行业AI的下一种竞争方式
Astra for Law最值得关注的地方,不是OpenAI宣布又有一个专业版本,而是它揭示了通用模型进入高价值行业的路线。
当基础模型已经具备较强推理和写作能力后,决定实用性的可能不再只是参数量和通用排行榜,而是能否访问完整、最新且可追溯的数据,能否遵守组织权限,能否连接现有软件,以及是否让专业人员方便地检查每一步。
法律领域尤其能放大这种差异。普通聊天模型可以迅速生成一篇像法律意见书的文字,真正可用的系统却必须证明引用没有失效、事实没有混淆、权限没有越界,并让律师能够回到原始资料复核。
因此,Astra for Law还不是“AI律师”,也没有证明律师可以退出工作流程。它更接近一个由前沿模型、专业搜索、律所知识和治理控制共同组成的法律工作平台。