OpenAI联手Ironclad发布GPT-6合同评测:得分55%胜GPT-5.6,任务耗时减半

OpenAI与AI合同管理公司Ironclad在10月6日联合发布了一份重磅研究报告:GPT-6 Astra在合同工作流专项评测中平均得分55%,比前代GPT-5.6 Sol高出32%,单次任务平均耗时从37分钟压缩至19.2分钟,效率提升48%。这项研究代表了AI智能体在专业法律领域评估的最新基准。

为什么合同工作流是AI能力的试金石

合同管理是企业中出错代价最高的流程之一。一份采购合同漏掉财务审批阈值,可能导致未经授权的采购;一份保密协议未按司法辖区更新,可能产生法律效力瑕疵。传统上,这类工作由熟悉业务流程的法务人员完成,平均每项任务耗时30-40分钟。

OpenAI在2026年9月底发布GPT-6 Astra时,已展示模型操作电脑完成文档准备、网页测试等专业场景的能力。与Ironclad的合作则将难度推向更高层级:让AI在真实的合同管理软件环境中,理解一家公司的业务规则,执行多步骤审批流程,并验证最终结果是否符合原始需求。

11项任务、多维度评分:如何量化AI合同能力

OpenAI与Ironclad共同设计了覆盖法务、商务和采购三个领域的11项合同任务,每项任务对照8-50个评分维度进行考核,替代传统的「通过/不通过」二元判断。这种精细化评分可以准确反映模型在哪些环节正确、哪些环节失误。

任务类型包括:配置保密协议条款、搭建采购审批流程、按申请人选择的司法辖区更新可复用法律条款等。Ironclad提供了托管版软件环境供模型练习,并派出内部法务人员和在OpenAI内部使用Ironclad的员工,共同定义「成功」的标准。

评测结果:GPT-6 Astra全面领先GPT-5.6 Sol

评测结果见下表(数据来源:OpenAI官方研究博客):

指标 GPT-5.6 Sol(High推理) GPT-6 Astra(Max推理) 差距
平均评分 41.6% 55.0% +32%
单次任务平均耗时 37.0分钟 19.2分钟 -48%
内部开发模型得分 — 63.7% (参考)

同一任务案例中,GPT-6 Astra在约20分钟内满足约94%的评分标准,而GPT-5.6 Sol在约32分钟内满足约85%的标准。这说明新一代模型不仅更快,准确性也明显更高。

Ironclad加入OpenAI:从客户到「评估标准」制定者

这项合作并非偶然。Ironclad自2023年起就在产品中集成OpenAI模型(最初为GPT-4),后来将合同数据接入ChatGPT。2026年,Ironclad联合创始人Jason Boehmig直接加入OpenAI,担任新方法务垂直业务负责人。这次研究合作的评估标准,正是由他带领的Ironclad团队参与制定的。

对OpenAI而言,这种「让垂直领域专家定义成功标准」的范式,正在成为训练专业AI智能体的标准路径。OpenAI在公告中表示,正面向更多软件公司开放类似合作通道,要求合作方提供具体失败案例、领域专家、测试环境以及可安全用于研究的数据。

55%得分意味着什么:优势与局限

55%的平均得分意味着GPT-6 Astra在合同任务上的表现已显著超越随机水平,但也意味着约一半的评分维度仍未被满足。在实际法务场景中,没有总法律顾问会批准AI在无监督状态下独立完成合同工作。

局限性包括:评测任务由Ironclad与OpenAI联合设计,GPT-6 Astra在训练中接触过类似任务,跨企业的泛化能力尚待独立验证;合同流程因行业、司法辖区、企业规模不同存在巨大差异;55%的得分对应的是简化后的研究任务,商业部署的真实环境远比评测环境复杂。

展望:AI合同智能体的下一步

OpenAI已明确表示,GPT-6 Astra是首个在Ironclad合同任务上训练的前沿模型,而内部开发模型63.7%的得分说明这一方向仍有很大提升空间。OpenAI正在向更多专业软件公司发出邀请,将高难度、高价值的专业任务转化为AI训练课题。

对法律科技行业而言,这一评测结果的含义清晰:AI智能体进入专业领域的速度比预期更快,但「进入」不等于「替代」。未来数年内,AI更可能的角色是法务团队的「超级助手」——接管标准化流程,让人类专注在例外处理和战略判断上。

FAQ

GPT-6 Astra在合同任务上的得分55%是什么水平?

55%是11项合同任务上的平均得分,对照每项任务8-50个评分维度计算而来。代表模型在约一半的维度上达到合格标准,仍无法独立完成完整合同流程,但在辅助场景下已具实用价值。

GPT-6 Astra与GPT-5.6 Sol的主要差距在哪里?

核心差距体现在两个方面:一是理解业务规则并将其转化为软件配置的能力;二是跨步骤保持上下文一致性的能力。GPT-5.6 Sol在单步操作上接近Astra,但在需要多步协调的场景下失误率显著更高。

企业现在可以用GPT-6 Astra做合同自动化吗?

不建议在没有人工审核的情况下完全依赖AI完成合同工作。55%的平均得分意味着近半数评分维度未满足,实际部署中需要人工复核环节。更现实的路径是AI处理标准化流程,人类专注例外和决策。

相关阅读