ARTICLE · 人工智能

展示置信度而不伪造精确性

作者:Multigrid 来源:DEV Community: machinelearning 2026-08-08 06:57 6 分钟 6 阅读 1339 字
LLMAI 产品设计UX 设计置信度校准自动化偏差
一语总结

本文认为,显示模型生成的置信度百分比会误导用户,并提出一种基于溯源信息的展示框架(已核实、未验证、矛盾、不稳定),诚实地反映验证状态,而非伪造精确性。

AI 总结

文章剖析了 LLM 系统中置信度数字的四个来源:模型自述置信度(只是合理的文本接续,不是概率)、token 对数概率(是对下一个 token 的概率,不是真实性)、多次采样的一致性(衡量稳定性,而非正确性)、以及外部验证(唯一衡量实际正确性的来源)。文章解释了为什么百分比展示是有害的:它暗示了底层信号并不支持的校准性和区分度,并触发自动化偏差,导致用户对高置信度输出减少核验。作者建议用四态溯源展示取代标量百分比——已核实(有引用来源片段)、未验证(仅有模型知识)、矛盾(验证发现不一致)、不稳定(采样结果不一致)——这种方式诚实、可操作,并且与用户的二元决策(核验或不核验)相匹配。文中还给出代码示例,展示如何计算并显示稳定性信号(“5 次运行中 4 次一致”),而不将其重新标记为概率。文章最后指出,置信度指标只有在低置信度情况下引导用户注意力时才有价值,而数字显示仅对经过评估的狭窄任务且已测量校准性的场景才是合理的。

核心要点
  1. 模型自述的置信度并非概率;它们是从训练数据中学到的合理文本接续。

    当模型输出“我有 87% 的把握”时,它是在生成一个看起来合理的短语,而不是在报告一项内部测量结果。这个数字反映的是训练语料中置信度表达通常是什么样子,而非任何计算出的不确定性。

  2. 只有外部验证能衡量正确性;其他信号衡量的是模型行为,而非事实真相。

    Token 对数概率衡量的是下一个 token 的可能性,多次采样的一致性衡量的是稳定性(并且可能存在一致的错误),而外部验证(检索、编译器、测试)是唯一能将陈述与事实真相相对照的来源。

  3. 百分比展示暗示了并不存在的校准性与区分度,并因自动化偏差而变得危险。

    显示 70% 会让人以为 10 条这类陈述中有 7 条为真(校准性),并认为 87% 与 84% 有实质性差异(区分度)。现代模型校准不良且过度自信;高百分比会抑制用户的核验,导致漏报和误报。

  4. 用四态溯源展示取代百分比:已核实、未验证、矛盾、不稳定。

    这些状态诚实地反映验证溯源,视觉上容易区分,并对应到用户的二元决策(核验或不核验)。它们避免了虚假的精确性,并在关键之处引导用户去审视。

  5. 稳定性信号(例如“5 次运行中 4 次一致”)对于结构化提取来说是诚实且成本低的,但绝不能重新标记为概率。

    采样一致性衡量的是采样器本身,而非真实世界。展示原始计数能保持诚实;转化为百分比则重新引入了这种设计想要避免的校准性主张。

展示置信度而不伪造精确性

文章剖析了 LLM 系统中置信度数字的四个来源:模型自述置信度(只是合理的文本接续,不是概率)、token 对数概率(是对下一个 token 的概率,不是真实性)、多次采样的一致性(衡量稳定性,而非正确性)、以及外部验证(唯一衡量实际正确性的来源)。文章解释了为什么百分比展示是有害的:它暗示了底层信号并不支持的校准性和区分度,并触发自动化偏差,导致用户对高置信度输出减少核验。作者建议用四态溯源展示取代标量百分比——已核实(有引用来源片段)、未验证(仅有模型知识)、矛盾(验证发现不一致)、不稳定(采样结果不一致)——这种方式诚实、可操作,并且与用户的二元决策(核验或不核验)相匹配。文中还给出代码示例,展示如何计算并显示稳定性信号(“5 次运行中 4 次一致”),而不将其重新标记为概率。文章最后指出,置信度指标只有在低置信度情况下引导用户注意力时才有价值,而数字显示仅对经过评估的狭窄任务且已测量校准性的场景才是合理的。

文章金句

"

“我有 87% 的把握”是模型生成的一句话。它不是测量结果,不是计算出来的,也没有经过任何检验。

"

置信度指标不只是提供信息,它还会重新分配用户的注意力。高置信度附着在错误答案上,比没有分数更糟,因为它撤走了本可以发现问题的审视。

"

用户据此做出的决策在实践中是二元的——核验或不核验——因此四档展示已经超过了该决策所需的分辨率。

"

“5 次运行中 4 次一致”是对已发生事实的陈述。“80% 有把握”则不是。