Más del 30% de los nuevos artículos en arXiv están escritos con IA
Un análisis de 12.750 papers revela que un tercio de los textos recientes parecen generados por IA. Computer Science lidera con un alarmante 65%.
En resumen
- Un estudio analiza 12.750 papers de arXiv con un detector calibrado al 0,4% de falsos positivos.
- Un análisis de 12.750 papers revela que un tercio de los textos recientes parecen generados por IA. Computer Science lidera con un alarmante 65%.
- Lo más interesante es cómo lo midieron. El detector está calibrado con un 0,4% de falsos positivos sobre textos anteriores a ChatGPT.
Llevo años siguiendo arXiv, el repositorio donde la ciencia se publica antes de pasar por revisión. Y llevo meses notando que algo huele raro. Demasiados papers con la misma estructura, el mismo ritmo, las mismas muletillas. Ahora un estudio de unslop.run lo confirma con datos: alrededor del 32% de los nuevos artículos en arXiv leen como escritos por IA, con picos del 39% a principios de 2026.
Lo más interesante es cómo lo midieron. El detector está calibrado con un 0,4% de falsos positivos sobre textos anteriores a ChatGPT. Es decir, de cada 250 papers escritos por humanos antes de 2023, solo 1 activa la alarma. Y aun así, la curva se dispara. No es ruido del detector: es la señal.
Computer Science, el caso más extremo
El estudio clasifica los resultados por disciplinas, y las diferencias son enormes. Computer Science lidera con un 65% de papers marcados como generados por IA. Le siguen Biología Cuantitativa (56,3%) e Ingeniería Eléctrica (51,3%). En el otro extremo, Matemáticas apenas registra un 0,7%, aunque los autores reconocen que su detector funciona peor con papers llenos de notación simbólica.
Esta disparidad tiene lógica: las disciplinas donde el inglés académico es más predecible y las estructuras más repetitivas son las que más se prestan a la generación automática. Un paper de Organization Science reporta que las revistas académicas han visto un aumento del 42% en envíos desde la llegada de ChatGPT, pero la calidad de escritura ha caído.
Más allá de la detección binaria
La mayoría de detectores tratan de clasificar si un texto es IA o humano. Pero la realidad es más difusa. Un paper de junio de 2025 en arXiv propone medir el grado de participación humana en lugar de hacer una clasificación binaria. Y encuentran que todos los detectores comerciales fallan al estimar cuánto ha intervenido una persona. Su método basado en BERTScore alcanza un F1 de 0,9423, pero el problema de fondo sigue siendo el mismo: la colaboración humano-máquina ya es mainstream y las herramientas de detección no están a la altura.
NeurIPS 2026, uno de los congresos de IA más importantes del mundo, ha tomado cartas en el asunto. En su Position Paper Track de junio exigieron que todos los artículos fueran "sustancialmente escritos por humanos", permitiendo IA solo para corrección editorial. No es la primera conferencia en hacerlo, pero el gesto revela hasta qué punto el problema ha escalado.
El problema de la revisión por pares
Si un tercio de los artículos nuevos están escritos con IA, ¿quién revisa a los revisores? El volumen de envíos se ha disparado, y la revista Nature ya advirtió en mayo de 2026 que las herramientas para estimar el uso de IA son todavía insuficientes. Los editores se encuentran atrapados entre reviewers humanos desbordados y detectores automatizados que no distinguen entre edición ligera y texto generado desde cero.
Lo peor es que no hay una solución fácil. El propio estudio de unslop.run es honesto sobre sus limitaciones: un flag no es autoría, un texto marcado puede ser edición pesada asistida por IA, y el detector es más sensible a unos generadores que a otros. La prevalencia real es, probablemente, mayor de lo que miden.
Lo que esto significa para la ciencia
No creo que el problema sea que la IA escriba papers. El problema es que estamos usando la herramienta equivocada para medirlo y el sistema de revisión por pares no está diseñado para este volumen. Si de verdad el 65% de los papers de Computer Science usan IA para escribir, la pregunta no es si debemos permitirlo. La pregunta es cómo adaptamos el sistema para que la ciencia siga siendo fiable cuando la herramienta de escritura es indistinguible del autor.
Al final, el detector de unslop.run no es una amenaza para los científicos que usan IA. Es una llamada de atención para los que piensan que el problema no existe.
Los datos están sobre la mesa: un tercio de la literatura científica recién publicada tiene trazas de IA. La conversación debería empezar a girar en torno a cómo convivir con esto, no a cómo prohibirlo. Porque el genio ya no va a volver a la botella.