ARTICLE · 人工智能

监管中的计算阈值,解释

作者:Multigrid 来源:DEV Community: machinelearning 2026-08-08 06:56 5 分钟 2 阅读 1125 字
AI 政策AI 监管计算阈值AI 治理LLM
一语总结

本文解释了计算阈值在 AI 监管中的运作方式、将 FLOP 计数转换为 GPU 小时的算式、代理的四大局限(训练后、蒸馏、推理时计算、效率漂移),以及监管者为何在存在缺陷的情况下仍使用它。

AI 总结

本文提供了对计算阈值作为 AI 政策监管工具的清晰技术解释。文章首先定义阈值在机械上触发的内容(通知、评估、网络安全、文档),而非禁止。核心贡献是算式:训练 FLOP ≈ 6 × 参数 × token, 加速器小时 = FLOP / (峰值 FLOP/s × 利用率 × 3600),并明确讨论了精度、利用率和定价如何影响实际适用范围。作者指出代理遗漏的四个方面:训练后/微调(计算量低几个数量级)、蒸馏(能力转移至小模型)、推理时计算(推理模型)、效率漂移(固定阈值随时间变宽)。第五点,诱导(elicitation),说明部署的系统配合工具/支架与原始权重在本质上有差异。对阈值的辩护是相对的:能力评估易被操纵且会陈旧;“frontier”没有法律定义;收入/用户阈值捕捉的是部署规模而非能力。计算阈值可在运行前估算,难以造假,并适用于可计数的大型组织集合。文章最后提供了阅读实际监管文本的实用检查清单(累计计数 vs 单次运行、是否包括微调、义务主体、调整机制、后果)。

核心要点
  1. 计算阈值触发义务(通知、评估、网络安全),而非禁止训练。

    跨越 FLOP 阈值意味着开发者必须向监管机构报告,进行评估,报告事件,保护模型权重,并记录整个过程——这并不禁止训练运行。

  2. FLOP 转换为 GPU 小时的计算关键取决于训练精度下的峰值 FLOP/s、实际利用率以及加速器的定价。

    训练 FLOP ≈ 6 × 参数 × token。加速器小时 = FLOP / (P_peak × U × 3600)。P_peak 随精度格式而变化,U(利用率)在实际中远低于 1,price_per_hour 在现货、预留和自有硬件之间相差一个数量级。

  3. 该代理遗漏了四大主要能力路径:训练后/微调、蒸馏、推理时计算以及效率漂移。

    微调可以在计算量低 3-4 个数量级的情况下改变拒绝行为;蒸馏将能力转移到小模型;推理模型在推理时消耗大量计算;随着效率提升,固定阈值每年都会变得宽松。

  4. 监管者使用计算阈值是因为其他任何方案在管理上都更糟,而不是因为它是一个好的能力代理。

    能力评估容易被操纵且会陈旧;“frontier”没有法律定义;收入/用户阈值捕捉的是部署规模。计算阈值可在运行前估算,难以造假,并适用于可计数的大型组织集合。

  5. 阅读监管文本时,需检查五个实务细节:累计计数 vs 单次运行、是否包括微调、义务主体、调整机制以及实际后果。

    持续的预训练使累计计数与单次运行的区别变得关键;部分草案为微调设立单独阈值;义务可能落在训练者、部署者或付款方;委托行为允许在无需新立法的情况下更新阈值;后果范围从通知到批准要求不等。

监管中的计算阈值,解释

本文提供了对计算阈值作为 AI 政策监管工具的清晰技术解释。文章首先定义阈值在机械上触发的内容(通知、评估、网络安全、文档),而非禁止。核心贡献是算式:训练 FLOP ≈ 6 × 参数 × token, 加速器小时 = FLOP / (峰值 FLOP/s × 利用率 × 3600),并明确讨论了精度、利用率和定价如何影响实际适用范围。作者指出代理遗漏的四个方面:训练后/微调(计算量低几个数量级)、蒸馏(能力转移至小模型)、推理时计算(推理模型)、效率漂移(固定阈值随时间变宽)。第五点,诱导(elicitation),说明部署的系统配合工具/支架与原始权重在本质上有差异。对阈值的辩护是相对的:能力评估易被操纵且会陈旧;“frontier”没有法律定义;收入/用户阈值捕捉的是部署规模而非能力。计算阈值可在运行前估算,难以造假,并适用于可计数的大型组织集合。文章最后提供了阅读实际监管文本的实用检查清单(累计计数 vs 单次运行、是否包括微调、义务主体、调整机制、后果)。

文章金句

"

计算阈值是触发器,而非禁止。训练模型的浮点运算次数超过某个数值时,会附加一系列义务——通常是在运行前后进行通知、评估计划、事件报告、围绕权重的网络安全措施以及文档记录。

"

诚实的总结是,它是能力的糟糕代理,却是‘组织规模足够大、通知义务不成负担’的可用代理。如果立法者的目标是如此,则该工具有效。若要捕捉危险模型,则需要配合其他手段,而目前尚无合适的候选方案。

"

这其中的两个术语解释了本页为何未引用美元数字。P_peak 取决于所使用的加速器以及数值精度——同一芯片在不同格式下的数值差异很大,将阈值与错误精度的营销数字比较是此算式中最常见的错误。