Modelos de IA Muestran Desacuerdos Significativos en la Verificación de Hechos
- Cinco modelos avanzados de IA no estuvieron de acuerdo en la precisión de afirmaciones en el 67% de los casos.
- Solo hubo acuerdo unánime en 328 de 1,000 afirmaciones.
- El puntaje alfa de Krippendorff fue de 0.639, por debajo del umbral de fiabilidad de 0.8.
- En el 34% de los desacuerdos, un modelo etiquetó una afirmación como verdadera mientras que otro la etiquetó como falsa.
- Ninguna afirmación recibió un veredicto unánime de «mayormente verdadera» entre los modelos.
Un estudio reciente encontró un desacuerdo significativo entre cinco modelos de IA de vanguardia cuando se les encargó la verificación de afirmaciones del mundo real, destacando posibles problemas de fiabilidad para los usuarios que dependen de estos sistemas para la verificación precisa de información.
El estudio indica que, aunque los modelos de IA pueden ofrecer juicios estructurados, su inconsistencia plantea dudas sobre su efectividad como únicos verificadores de hechos, especialmente dado su fracaso para coincidir en verdades matizadas.