AI 律师幻觉:为什么 AI 律师会凭空捏造案件

AI 律师工具承诺提供即时法律检索,但它们也会编造出从未存在过的法院判例。一个 AI 律师可以生成一份自信满满、格式规整的诉状,却充斥着虚构的引证,而提交此类诉状的律师已经因此被罚款并被停业。

An attorney finds fabricated citations in an AI-generated brief

这种现象被称为 AI 幻觉:模型生成的是听起来正确的文本,而不是真正正确的文本。最具标志性的案例 Mata 诉 Avianca 案,最终以 5,000 美元的制裁告终。

法律中的 AI 幻觉是什么?

法院实际采用的定义

如今法院和研究人员对这个术语已经有了相当精确的定义。根据美国州法院国家中心关于 AI 幻觉的指南,法律文书中的 AI 幻觉通常归为以下四类之一:

  • 虚构的案件引证——在判例汇编系统中任何地方都不存在的案件。
  • 曲解的裁判要旨——引用一个真实案件,却将其从未确立过的法律规则强加于它。
  • 虚假的程序信息——捏造的案卷编号、立案日期或法院审理历史。
  • 不存在的法条引文——将从未写入某部真实法规的文字归于该法规。

其根本原因是结构性的:大型语言模型追求的是合理性,而非真实性。正如 NCSC 所说,模型倾向于“生成听起来正确的文本,而不是真正正确的文本”。这一句话就解释了本文后续大部分内容。

一名律师在 AI 生成的诉状中发现虚构的引证

一名律师在 AI 生成的诉状中发现虚构的引证

幻觉与普通错误的区别

幻觉不是引证中的一个笔误或搞错了页码——那些是任何律师都可能犯的普通人为错误。幻觉是凭空捏造出来的案件,而在 Mata 诉 Avianca 案中,这意味着一次性出现了多个虚构要素:

  • 从未出现在任何真实纠纷中的虚构航空公司被告。
  • 捏造的案卷编号,没有任何对应的法院记录。
  • 归于从未写下这些话的法官的内部引述。
  • 案件名称在结构上足够逼真地模仿真实的航空诉讼,从而听起来煞有介事。

ChatGPT 并不是错误引用了某起真实存在的航空公司纠纷——它根据自己学到的模式构建出了完整的案件,还配上了虚构的内部引证。

为什么 AI 律师会捏造虚假案件

大型语言模型的真实运作方式

一个建立在通用 LLM 之上的 AI 律师工具,并不像 Westlaw 或 LexisNexis 那样检索真实判例法数据库。它是根据从训练文本中学到的模式,逐个词元地预测下一个统计上最可能出现的词。它没有一个内置的检查机制去追问“这个案件真的存在吗?”——当模型触及自己知识的空白时,它会用一个看起来结构正确的引证来填补这个空白,因为它见过成千上万个那种形状的引证。这就是为什么那些虚构的案件名称、判例汇编和年份乍看之下都很合理。

有关法律准确性的数据

这个问题的规模已经被直接测量过。研究者 Matthew Dahl 及其同事在 2024 年发表了《大型法律虚构》(“Large Legal Fictions”),在通用 LLM 上测试法律查询,发现幻觉率在 58% 到 88% 之间,具体取决于模型和所提问题的类型。SCOTUSblog 另行进行的一项测试向 ChatGPT 提出了 50 个有关最高法院案件的问题,它只答对了 21 个。研究人员得出的结论是一致的:无论输出听起来多么自信,通用聊天机器人在没有独立核实的情况下都不可靠,不能用于判例法检索。

印刷成册的可靠判例法与不确定的 AI 输出形成对比

印刷成册的可靠判例法与不确定的 AI 输出形成对比

Mata 诉 Avianca 案:引发这一切的案件

事情经过

2022 年 2 月,Roberto Mata 在纽约州法院起诉 Avianca,称在一次国际航班上有一辆餐车据称撞到了他的膝盖;该案后来被移送至纽约南区联邦地区法院。他的律师 Steven Schwartz 使用 ChatGPT 帮助起草答辩状。该工具生成了大约六个并不存在的案件,每个都配有虚构的航空公司被告、编造的内部引述和伪造的案卷编号。

掩盖使情况变得更糟

当 Avianca 的律师找不到所引用的任何案件时,法院命令 Schwartz 的团队提交这些判决意见的副本。这些律师没有在那一刻承认错误,反而让 ChatGPT 生成看起来像是那些虚假裁决文本的内容,并把它们也一并提交了。审阅这份提交材料时,法官 P. Kevin Castel 将其中一份虚构的法律分析形容为“胡言乱语”。

提交的六个案件看来是伪造的司法判决,带有伪造的引述和伪造的内部引证。—— 法官 P. Kevin Castel,Mata 诉 Avianca 案判决意见

制裁

2023 年 6 月,Castel 法官依据《联邦民事诉讼规则》第 11 条,以恶意行事为由对这些律师处以 5,000 美元的制裁。命令中还包含一项不同寻常的要求:这些律师必须亲自通知每一位被虚假署名为某份捏造判决意见作者的真实联邦法官。Mata 诉 Avianca 案成为此后几乎每一场关于诉讼中 AI 幻觉讨论所引用的标志性案件。

规模:AI 幻觉在法庭上有多常见?

Solid printed case law contrasts with uncertain AI output

一个不断扩大的数据库

Mata 诉 Avianca 案并非孤例。任职于巴黎高等商学院(HEC Paris)的法律研究者 Damien Charlotin 维护着一个 AI 幻觉案件数据库,追踪全球范围内已确认涉及 AI 生成的虚构法律内容的法院裁决。截至 2026 年年中,该数据库已记录了超过 1,700 起有据可查的案件,而且速度急剧加快——从 2025 年之前的每月约两三起新案件,增加到现在的每天约五起。

一个法庭场景,因虚假 AI 引证而实施的制裁
A courtroom scene of sanctions for fake AI citations

一个法庭场景,因虚假 AI 引证而实施的制裁

不仅限于自我代理的当事人

一个常见的假设是,这个问题仅限于没有律师、自行代理诉讼的人。但数据库显示情况并非如此:自我代理的当事人(pro se litigants)占了很大一部分,而持牌执业律师同样占据了相当大的比例。

An attorney cross-checks a citation against a printed case reporter
类别大致数量
自我代理当事人1,027
持牌律师682
法官24

错误的类型也各不相同。完全虚构的引证是最常见的问题,其次是被歪曲的裁判要旨和归于真实案件的虚假引述。

错误类型大致数量
虚构的引证1,465
被歪曲的裁判要旨723
虚假引述476

制裁、停业与除名:律师面临的风险

不断升级的处罚

自 Mata 诉 Avianca 案设定初始基准以来,提交 AI 幻觉材料的后果稳步加重。以下是各司法管辖区法院应对方式的一个概览。

案件处罚
Mata 诉 Avianca 案(2023 年 6 月)依第 11 条处以 5,000 美元制裁
Zachariah Crabill(2023 年 11 月)停业 1 年零 1 天(已执行 90 天,其余部分缓期并附缓刑观察)
Wadsworth 诉 Walmart 案(2025 年 2 月)罚款 3,000 美元,撤销临时出庭(pro hac vice)资格
Coomer 诉 Lindell 案(2025 年 7 月)对每位律师各罚款 3,000 美元
Whiting 诉 Athens 市案(2026 年 3 月)对每位律师各罚款 15,000 美元,第六巡回上诉法院
内布拉斯加州——Greg Lake(2026 年 4 月)63 处引证中有 57 处存在缺陷;无限期停业

趋势很明确:法院起初只是象征性的金钱罚款,而随着重复事件不断累积,已转向直接吊销执业执照。

处罚背后的伦理规则

第 11 条要求律师核实其提交的法律引证是准确的——声称不了解 AI 工具的运作方式并不能免除这项义务。2024 年 7 月,美国律师协会发布了第 512 号正式意见,这是首份针对法律实务中生成式 AI 的正式伦理指南。它将 AI 的使用与现有的若干《职业行为示范规则》联系起来:

  • 规则 1.1(胜任能力)——律师必须理解在案件中所使用的任何 AI 工具的能力与局限。
  • 规则 1.4(沟通)——当在案件中使用生成式 AI 时,可能需要告知客户。
  • 《联邦民事诉讼规则》第 11 条——无论以何种方式生成,向法院提交的每一处引证都必须经过独立核实。

虚构的案件引证、编造的法条引文和幽灵般的案卷编号,全都落入这同一项核实义务之下。

如何在使用 AI 律师时避免受到制裁

在核实之前,绝不要信任 AI 的法律输出。 这是关于该主题所发布的每一套最佳实践背后的唯一原则,包括 NCSC 面向从业者的指南。要把 AI 律师工具生成的每一处引证、引述和案件摘要都当作一项必须在接近任何文书提交之前先行确认的草稿主张。

一名律师将引证与印刷版判例汇编逐一核对

一名律师将引证与印刷版判例汇编逐一核对

为每一处引证保留人工把关。 从真实判例法数据库中检索的专用法律 AI 工具,相比通用聊天机器人降低了幻觉率,但斯坦福研究人员的独立测试发现,即便是基于检索的法律工具,仍会偶尔产生虚构内容。工具可以缩小风险,却无法免除律师核实的责任。在实践中,这种核实意味着直接核对第一手来源,而不是信任 AI 的摘要:

  • Westlaw 或 LexisNexis,用于查证任何被引用案件的权威版本。
  • CourtListener,用于免费查阅联邦和州的判决意见及案卷。
  • govinfo.gov,用于查阅联邦法规、条例和官方政府出版物。

这些工具都无法免除阅读实际裁判要旨的必要,但它们首先能确认案件确实存在。

如果幻觉漏了过去,应立即更正并披露。 如果在提交后发现了虚构的引证,NCSC 的立场是立即予以更正,并同时通知法院和对方律师,而不是等着对方来发现这个错误。

以下是在任何 AI 辅助的文书提交发出之前,可以逐项运行的一份实用检查清单:

  1. 在核实之前,把每一份 AI 生成的草稿都视为未经查证。
  2. 在第一手来源中直接打开每一个被引用的案件——Westlaw、LexisNexis、CourtListener 或 govinfo.gov。
  3. 确认实际的裁判要旨与 AI 所声称的相符,而不仅仅是确认案件存在。
  4. 指定一位记录在案的律师,亲自对每一处引证签字确认(人工把关)。
  5. 如果发现幻觉,立即更正并通知法院和对方律师。
  6. 记录核实步骤,以便日后受到质疑时能够出示。

YMYL 免责声明

本文为一般性信息,并非法律意见。AI 律师工具(包括本网站)可能出错,在未经持牌律师核实之前,绝不可依赖。对于任何真实的法律事务,请咨询在您所在司法管辖区获得执业许可的合格律师。