Semantic Entropy
了解语义熵如何衡量 LLM 答案含义的不确定性、区分相互矛盾的答案,并支持更安全的 AI 评估和幻觉检测。
语义熵衡量生成式 AI 模型对其答案含义的不确定程度。它不会将每种措辞差异都视为不同结果,而是将语义等价的回答归为一组,并衡量概率在这些不同含义之间的分布范围。如果重复生成的回答表达了同一个一致的观点,语义熵就较低。如果这些回答支持多个相互矛盾的观点,语义熵就较高,这表明模型可能并不确定哪个答案正确。
这一指标对大型语言模型 (LLM)或其他生成自由形式语言的系统尤其重要,因为相同的含义可以通过许多不同的词语序列表达。
语义熵的工作原理#
熵是衡量概率分布不确定性的一般指标:当概率集中在一种结果上时,熵较低;当多种结果仍有可能时,熵较高。NIST 对熵的定义提供了底层的信息论概念。(csrc.nist.gov)
语义熵工作流通常包含四个步骤:
- 使用采样方法针对同一输入生成多个响应。
- 将表达相同含义的响应归为一组。
- 根据每种含义出现的频率或生成概率估算其概率。
- 计算这些语义分组的熵。
例如,“巴黎”“答案是巴黎”和“法国的首都是巴黎”属于同一个含义组。“里昂”则属于另一个组。词汇熵可能会把这四个字符串都视为不同内容,从而夸大不确定性;语义熵则能识别出前三者表达的意思一致。
分组阶段可以采用人工判断、文本蕴含,或数值嵌入,并结合scikit-learn 余弦相似度等相似度度量。
from collections import Counter
from scipy.stats import entropy
# Equivalent answers have already been assigned the same meaning label.
meaning_labels = [
"Paris",
"Paris",
"Paris",
"Lyon",
"Unknown",
]
counts = Counter(meaning_labels)
probabilities = [count / len(meaning_labels) for count in counts.values()]
score = entropy(probabilities, base=2)
print(f"Semantic entropy: {score:.3f} bits")这个简化示例使用了文档说明的SciPy 熵函数。在生产系统中,必须仔细验证语义分组,因为错误分组可能会扭曲最终分数。
相关概念与关键区别#
语义熵属于更广泛的不确定性量化领域,但它关注的是含义层面的不确定性,而不只是标签、词元或数值预测的不确定性。
- 词元熵衡量下一个词元或完整词元序列的不确定性。无关紧要的措辞差异也可能导致词元熵较高。
- 自一致性检查重复生成的答案是否彼此兼容。语义熵扩展了这一思路,进一步表示不同含义的相对分布。
- 置信度通常是附加到单个预测上的分数。语义熵则比较多种可能的生成结果。两者都不应自动被解读为经过校准的概率;必须根据观测结果评估校准情况。(scikit-learn.org)
- LLM 幻觉是指生成内容错误、缺乏依据或具有误导性。语义熵是预警信号,而非错误本身。高熵可能表明答案相互矛盾,而低熵并不能证明答案正确,因为模型可能会一再重复同一个错误说法。因此,幻觉也可能表现得很有把握且内部一致。(openai.com)
- 语义分割为图像中的每个像素分配一个类别。尽管共享“语义”一词,但它是计算机视觉任务,与生成含义的熵无关。
实际应用#
问答助手:客服助手可以在回复前采样生成多个答案。如果输出对于保修是否涵盖意外损坏意见不一,高语义熵就可以触发文档检索、澄清或人工审核。结合检索增强生成 (RAG)后,这能降低缺乏依据的政策说法传达给客户的概率。
视觉语言决策支持:视觉语言模型 (VLM)在重复生成时,可能将一张工业图像描述为“表面腐蚀”“油渍”或“正常变色”。高语义熵表明存在实质性分歧,可能导致错误的维护决策。系统可以将图像交由检查员处理,而不是把某一种流畅的描述视为定论。
实际应用与局限#
语义熵应被视为基于风险的评估流程中的一个组成部分。团队应测试分数升高是否确实对应其领域中更多的错误,根据错误后果选择阈值,并保留弃答或人工审核机制。NIST AI 风险管理框架核心强调衡量不确定性,并将评估结果与持续风险监控相结合。(airc.nist.gov)
语义熵最适用于开放式生成输出。结构化计算机视觉预测需要采用不同的评估方法:Ultralytics 验证模式根据标注数据衡量性能,而语义熵可以评估多模态组件所添加的任意自由文本说明。
生产团队还应跟踪分数分布、故障类别、延迟以及输入数据的变化。Google 关于监控生产机器学习系统的指南建议记录日志并针对预测漂移和质量下降设置警报。Ultralytics Platform 部署监控可支持视觉模型相关的标注、训练、部署和监控等完整工作流。语义熵可以在该工作流中识别不确定案例,但事实核验和有代表性的测试仍不可或缺。









