Resultados · junio 2026

¿Sueñan las IA
con escrituras humanas?

Para este experimento, 429 personas intentaron distinguir textos escritos por humanos y textos generados por IA imitando distintos estilos. Las respuestas estuvieron cerca del azar, pero el análisis es más complejo. Aquí presentamos algunos de los resultados y cifras para que cada quien pueda sacar sus propias conclusiones.

Este trabajo replica en español la metodología que usó Jay Caspian Kang para The New Yorker: diez rondas, textos breves, sin las marcas más obvias de escritura sintética.

429
personas jugaron
54,1%
acierto global
53,8%
de los textos IA pasaron como humanos
168
encuestas completadas
Hallazgo central

La IA logró camuflarse cerca de la mitad del tiempo

El acierto global fue 54,1%. Cuando el texto era humano, se identificó bien el 62,1% de las veces. Cuando era IA, solo el 46,2%. Más de la mitad de los textos sintéticos fueron clasificados como humanos.

Acierto según tipo de texto
Texto humano
62,1%
Texto IA
46,2%
Azar (referencia)
50,0%

3.395 respuestas individuales · 10 rondas

Sesgo: a qué tendían a decir
Dijeron "humano"
58%
Dijeron "IA"
42%

De los 1.705 textos de IA presentados, 918 —más de la mitad— fueron clasificados como humanos.

Presunción de humanidad
Si no hay marcas visibles, hay una tendencia a creer que el texto fue escrito por un humano. Este sesgo opera a favor de la IA: cuando un texto sintético "suena bien", se lee sin sospechar.
Un 18,5% sacó exactamente 5 sobre 10
Casi una de cada cinco personas llegó al final con un resultado equivalente al azar puro. Los factores que pueden influir no tienen que ver solo con el texto: también influyen el dispositivo, la atención, el cansancio a la hora de leer.
Coincide con el experimento del New Yorker
En el experimento original de Kang, el acierto global fue del 52%, casi idéntico al nuestro. Lo que hicimos aquí fue replicarlo en español, con autores distintos y una audiencia diferente.
Dinámica del juego

La gente mejoró levemente al detectar IA, pero no al reconocer lo humano

Si comparamos las primeras cinco rondas con las últimas cinco, hay un patrón. El acierto sobre textos de IA aumentó 4 puntos. Quienes se equivocaron atribuyendo humanidad a textos sintéticos, luego leyeron con más atención. Pero el acierto sobre textos humanos se mantuvo casi igual en las últimas rondas.

Acierto sobre textos IA — por ronda
Ronda 2: 31%. Ronda 5: 53%. Oscilante pero con tendencia leve al alza.
Primera mitad vs segunda mitad
Textos de IA
Rondas 1–5
44,4%
Rondas 6–10
48,4%
Textos humanos
Rondas 1–5
62,3%
Rondas 6–10
61,9%

La ronda 2 fue la peor del juego (46,9% global), arrastrada por textos de IA que engañaron al 81% y al 70% de los participantes. Estos son esos textos:

Texto generado por IA · engañó al 81%

"Clara había aprendido a leer el futuro en el color del humo de la cocina, pero nunca le contó ese secreto a nadie porque sabía que su madre lo habría llamado superstición. Fue en esa cocina donde entendió que las mujeres de su familia cargaban el don y la desgracia juntos, como una sola herencia que no se podía dividir ni rechazar. El olor a canela y a leña mojada le recordaría toda la vida esa mañana de julio en que supo, sin que nadie se lo dijera, que su madre no volvería del hospital."

Texto generado por IA · engañó al 70%

"El sol había calentado las piedras durante ocho horas y ahora la yarará las usaba. Estaba quieta, con la cabeza apenas levantada, mirando el sendero con esa atención sin pensamiento que tienen las víboras cuando esperan. El hombre llegó silbando, con el machete al cinto y las botas abiertas por el calor. Vio la sombra negra sobre la piedra blanca medio segundo antes de sentir el golpe en el tobillo, y ese medio segundo fue suficiente para saber que no llegaría al rancho."

Perfil de participantes

La influencia de la lectura y la educación en el experimento

De las 429 que participaron, 168 personas completaron la encuesta. Los datos muestran patrones contraintuitivos: a mayor formación académica, menor score. Y aunque leer más sí da ventaja, la diferencia es mucho más pequeña de lo que se esperaría.

Score promedio por nivel educativo
Secundario
6,14
Univ. incompleto
6,33
Univ. completo
5,81
Posgrado
5,59
Score promedio por hábito lector
Casi nada
5,50
Sí, algo
5,52
Poco
5,87
Sí, mucho
6,11

Edad y rendimiento

Score promedio por grupo etario
20–30 años
5,68
31–40 años
6,21
41–50 años
5,85
51+ años
5,39
Edad promedio según score obtenido
Score 9: edad promedio 31,7. Score 8: 39,6. Score 5: 44,8. Score 1: 34,2.
Los 31–40: el mejor ojo colectivo
El grupo de 31 a 40 años tuvo el mejor desempeño promedio (6,21). Los tres únicos participantes que sacaron 9/10 tenían en promedio 31,7 años. Los 51+ fueron el grupo con peor resultado (5,39). La correlación entre edad y score es negativa (r = −0,12), aunque estadísticamente débil: la edad explica poco del rendimiento individual, pero el patrón grupal es consistente.
Distribución de resultados

La mayoría en el rango 5–7

Solo 3 personas sacaron 9/10 y 6 sacaron 1/10. El grueso se concentra en 5–7, lo que confirma que el experimento tuvo dificultad calibrada: no fue trivial ni imposible. El score 6 fue el más frecuente (46 personas).

Cantidad de participantes por score (n=168)
Score 5: 31. Score 6: 46. Score 7: 42. Score 8: 19. Score 9: 3.
27
Debajo del azar
score 1–4 · 16% de los encuestados
77
En zona gris
score 5–6 · 46% de los encuestados
64
Por encima del azar
score 7–9 · 38% de los encuestados
Conclusión

Podemos distinguirlos.
Pero no siempre
lo sabemos.

El resultado de este experimento no es que la IA ya escribe igual que los humanos. Es que, en condiciones de lectura casual y con textos breves, la diferencia se vuelve imperceptible en los detalles.

Lo que rescato de los 90 comentarios es que la gente sí percibe algo. Lo llaman "alma", "tirón en la panza", "lo inesperado", "el ritmo". No siempre saben explicarlo, pero lo sienten.

Quizás, como dice Flavia Costa en su último trabajo, la lectura atenta se convierta en un deporte de alto rendimiento, nuestra mejor arma para defender lo que nos hace humanos:

"En esta guerra, en la 'batalla cultural' del signo que sea, la clave —nuestra 'agencia'— es la lectura atenta. Todo lo que podamos ser, la libertad que está radicalmente en juego, depende de nuestras habilidades lectoras, nuestra capacidad de interpretación, la recepción como actividad cada vez más elaborada, reflexiva, autoconsciente. Y si nuestro ambiente cotidiano es un laberinto, la lectura pasa a ser un deporte de alto rendimiento. Es lo que nos permitirá captar el shock, la 'imagen dialéctica', la señal impredecible e inequívoca que nos llevará hasta el mástil al cual atarnos y anclar la nave, la mente, en medio de la tormenta semiótica ilimitada."

Flavia Costa · La gran batalla de nuestro tiempo
90 comentarios libres

Intuición 1, análisis 0

El 53,6% de quienes completaron la encuesta dejó un comentario. Estos son algunos de los resultados.

Lo que distingue al humano ×20
Emoción y entusiasmo ×20
Reconocimiento de textos ×15
Frustración ×10
Intuición vs análisis ×8
Miedo / inquietud ×8
Perfección como señal IA ×3

La trampa del análisis

Ocho comentarios mencionan explícitamente la tensión entre intuición y análisis. Casi todos concluyen lo mismo: cuando siguieron la primera impresión, acertaron; cuando se pusieron a analizar, erraron. Varios mencionan que la estrategia analítica fue exactamente la que la IA necesitaba para pasar desapercibida.

"Cuando seguí mi primera intuición, lo que me pasaba en el cuerpo al leer, fue cuando acerté. En cada intento que puse mucho análisis, me equivoqué. Mi cerebro se cree más inteligente que el tirón en la panza. El tirón en la panza casi siempre tiene razón."

"Me enredé tratando de recordar si eso que leía eran imitaciones o no, y quizás no presté atención a otras cosas. Caí en la trampa varias veces."

El reconocimiento como trampa doble

Varios participantes reconocieron textos originales (Funes el memorioso, A la deriva, La casa de los espíritus). Paradójicamente, eso los confundió más: si la IA podría estar imitando esos textos, ¿cómo confiar en el reconocimiento? La certeza se convirtió en sospecha.

"Aunque reconocí el inicio de 'A la deriva' de Quiroga, empecé a dudar de si no sería otro texto generado por la IA con instrucciones de qué imitar. Un 'si no' que debería haber sido 'sino' me hizo inclinarme por lo humano. Y acerté — aunque ahora sé que se pueden introducir erratas a propósito."

Lo que dicen los encuestados sobre las diferencias entre escritura humana y sintética

La perfección vacía
"Hay algo de 'perfecto y vacío' en la escritura de la IA que se aleja del alma de cualquier escrito humano." — "Puro ruido blanco." — "Efectivamente, si es demasiado 'perfecto' es IA." La percepción de exceso de corrección es la señal más citada. No errores, sino ausencia de imperfecciones significativas.
El cierre forzado
"Hay algo en los remates, como una necesidad de cerrar los asuntos" — Los textos de IA tienden a resolver lo que los textos humanos dejan abierto, ambiguo o sin resolución. Los cuentos de los grandes autores usan finales no resueltos, fracturas narrativas, silencios. La IA los cierra.
La ausencia de lo inesperado
"Lo que me facilitó detectar que era humano refería a la aparición de algo inesperado en el relato." La escritura humana tiene giros, elipsis, cosas que no tienen sentido inmediato pero resuenan. La IA genera lo estadísticamente probable: lo que "debería" venir a continuación, no lo que sorprende.
Lo digerible como señal
"Lo que era más escuchado, fácil, digerible solía ser de IA." Una participante lo comparó con "versiones bossa nova de temas de rock: algo puede llenar el vacío, el silencio de la sala de espera, pero no algo que alguien que quiera disfrutar de la experiencia iría a buscar." La fluidez perfecta puede ser una trampa.
La experiencia vivida como huella
"Traté de buscar marcas que indicaran experiencia, que la IA no puede tener como tal." La escritura humana contiene algo que no puede reproducirse sin haberlo vivido: el error específico, la duda concreta, la perspectiva encarnada en un cuerpo con historia. La IA puede describir la experiencia; no puede tenerla.
El desorden como garantía
"Hay algo de los escritos por humanos que se siente más desordenado, más genuino." — "No deja de ser difícil identificar la mecanicidad de la IA, aunque en parte el problema también está en que muchos de nuestros propios escritos son mecánicos, enlatados y repetitivos." El desorden, el accidente, la ruptura del patrón: eso es lo que la IA no puede simular de forma convincente.

Quiénes jugaron — y qué sintieron

Profe de letras

"Me da bronca no haber sacado 100... soy profe de Letras."

Editora — 8/10

"Me encanta detectar con tanta claridad la diferencia. Hay algo de 'perfecto y vacío' en la escritura de la IA. Escribí una nota para un diario sobre una obra que estaba dirigiendo, y al pedirle al GPT que la mejorara, al leerla me di cuenta que había perdido su 'alma'."

Docente de escritura — 8/10

"Enseño escritura académica y escritura creativa, y esto me resulta muy útil. Gracias."

Poeta

"Me frustró no poder detectar, especialmente porque escribo poesía y en mi trabajo corrijo muchos textos hechos con IA. Sentí que el patrón no solo estaba en lo predecible sino también en cierta forma extraña de construir las oraciones, que podría pasar por estilo pero a la vez no lo es."

La comparación más exacta — 8/10

"Leer textos que imitaban la prosa de autores que leí en mi juventud se sintió como escuchar versiones bossa nova de temas de rock. Algo puede llenar el vacío, el silencio de la sala de espera, pero no algo que alguien que quiera disfrutar de la experiencia iría a buscar."

La frase más precisa

"Asombra el acostumbramiento al contexto: somos la ranita..."

"La IA dice/escribe lo que es estadísticamente probable. Solo eso. Entrenada con datos aportados por millones de usuarios anónimos, no es generadora de verdad sino reproductora del 'sentido común' propio de la masa."

Jugar al experimento →
Metodología y limitaciones

Cómo se hizo

01
Los textos humanos son fragmentos auténticos de Borges (Funes el memorioso, Las ruinas circulares), Cortázar (Cronopios y famas, Carta a una señorita en París), Quiroga (A la deriva, El solitario), Allende (La casa de los espíritus, Eva Luna) y Ocampo (Los hombres animales, Las esclavas de las criadas). Fueron verificados manualmente tras detectar que una primera versión incluía textos fabricados o modificados por el modelo.
02
Los textos de IA fueron generados con Claude Sonnet 4.6 en modo esfuerzo bajo, con instrucciones de imitar el estilo de cada autor. En una segunda iteración, se eliminaron marcas evidentes de escritura sintética. Las instrucciones que el modelo se dio a sí mismo para imitar a cada autor están publicadas en la página del experimento.
03
El diseño presenta 10 rondas con un texto por ronda, alternando entre autores en orden variable. Cada texto puede ser humano o de IA; la proporción no es exactamente 50/50 en todos los casos pero se equilibra a nivel global. Los datos de cada respuesta se registraron en tiempo real vía Google Sheets y Apps Script.
04
La encuesta final recoge edad, nivel educativo, hábito de lectura y un comentario libre opcional. Es anónima. Los datos se analizaron en Python con pandas. El análisis estadístico es descriptivo; el n=168 no permite inferencias robustas sobre subgrupos pequeños.
05
Limitaciones: Los textos son cortos (un párrafo), lo que facilita la imitación y acota la diferencia perceptible. En textos más largos, las diferencias narrativas se vuelven más evidentes. La muestra es autoseleccionada — personas interesadas en el tema — más educada y lectora que el promedio. Los resultados no son generalizables. Varios participantes reconocieron textos específicos (Funes, A la deriva), lo que contamina la señal en esos casos.