IA y modelos
GPTZero encuentra citas alucinadas en trabajos de investigación de NeurIPS
GPTZero identificó 100 citas alucinadas en 51 trabajos de NeurIPS, un hallazgo considerado no estadísticamente significativo, aunque los organizadores señalan que la investigación no está necesariamente invalidada.
La startup de detección de IA GPTZero analizó 4841 trabajos aceptados por la Conference on Neural Information Processing Systems (NeurIPS), una importante conferencia de investigación en IA que se llevó a cabo el mes pasado en San Diego. A partir de este análisis, la empresa identificó 100 citas alucinadas en 51 trabajos. Si bien tener un trabajo aceptado en NeurIPS es un logro muy valorado por los investigadores de IA, los hallazgos sugieren que incluso los expertos líderes podrían estar confiando en modelos de lenguaje extensos (LLM) para generar referencias.
Sin embargo, este hallazgo tiene sus matices. Las 100 citas alucinadas confirmadas en 51 trabajos representan el 1.1% de los artículos, lo cual no es estadísticamente significativo dado que cada trabajo contiene decenas de referencias. Fortune reportó primero sobre la investigación de GPTZero. En respuesta a los hallazgos, los organizadores de la conferencia NeurIPS enfatizaron que las referencias inexactas no socavan automáticamente las contribuciones científicas del trabajo. Como NeurIPS le dijo a Fortune: “Incluso si el 1.1% de los trabajos tiene una o más referencias incorrectas debido al uso de LLM, el contenido de los trabajos en sí no está necesariamente invalidado”.
A pesar de la baja significancia estadística, la presencia de citas fabricadas por IA destaca un desafío creciente para la publicación académica. Se instruye a los revisores pares a señalar las alucinaciones, pero el gran volumen de presentaciones dificulta la verificación manual. GPTZero señaló que el objetivo de su análisis era proporcionar datos sobre cómo el contenido generado por IA ingresa a la literatura académica a través de un “tsunami de presentaciones” que ha tensado los procesos de revisión de las conferencias. La startup señaló un trabajo de mayo de 2025 titulado “The AI Conference Peer Review Crisis”, que detalló previamente cómo estos procesos de revisión en conferencias de primer nivel, incluida NeurIPS, están siendo llevados al límite por la afluencia de contenido generado por IA.
Por qué importa
Los hallazgos destacan la ironía de que expertos líderes en IA utilicen LLM para generar citas, al tiempo que subrayan la presión sobre los procesos de revisión por pares debido a un “tsunami de presentaciones” de contenido generado por IA.