AI模型在事实核查上存在显著分歧
- 五个先进的AI模型在67%的案例中对事实的准确性存在分歧。
- 只有328个案例中的1,000个案例达成了一致意见。
- Krippendorff’s alpha分数为0.639,低于0.8的可靠性阈值。
- 在34%的分歧中,一个模型将声明标记为真实,而另一个模型标记为虚假。
- 没有声明在所有模型中获得一致的“基本真实”判定。
一项最新研究发现,当五个前沿AI模型被要求核实真实世界的声明时,它们之间存在显著分歧,这突显了用户在依赖这些系统用于准确信息验证时可能面临的可靠性问题。
研究表明,虽然AI模型可以提供结构化的判断,但它们的不一致性让人质疑其作为唯一事实核查者的有效性,尤其是在对复杂事实的判断上未能达成一致。