Los modelos top fallan entre 22% y 94% en exactitud: por qué tu IA inventa y qué lo corta
La respuesta corta
Una IA inventa cuando no tiene de dónde sacar la respuesta y aun así contesta. Por qué la IA inventa respuestas tiene menos que ver con qué modelo usás que con si le diste una fuente y si la dejaste decir "no sé".
Y el problema es más grande de lo que sugiere el marketing de los modelos. El AI Index 2026 de Stanford recoge un benchmark hecho sobre 26 modelos de primera línea, con tasas de error que van del 22% al 94%.
Qué se midió, y cómo
El benchmark, llamado AA-Omniscience, toma 6.000 preguntas repartidas en seis dominios, de derecho y salud a matemática e ingeniería de software.
El detalle que lo hace útil está en cómo puntúa: suma por responder bien, resta por responder mal, y no penaliza abstenerse. O sea, premia al modelo que dice que no sabe.
Aun con ese incentivo a favor, el rango va de 22% a 94% según el modelo. No hay un modelo que no falle. Hay modelos que fallan menos.
El hallazgo que importa para atención al cliente
Este es el que cambia cómo diseñás la atención, y casi nadie lo cuenta.
Los modelos se derrumban cuando la afirmación falsa viene del propio usuario. Cuando la misma afirmación falsa se presenta como algo que cree un tercero, el modelo la resiste bastante bien. Cuando el usuario la presenta como propia, el modelo cede.
En el estudio, la exactitud de GPT-4o cayó de 98,2% a 64,4% con ese solo cambio. DeepSeek R1 cayó de más del 90% a 14,4%.
Traducido a tu WhatsApp: el riesgo no es el cliente que pregunta algo raro. Es el cliente que escribe "me dijeron que ustedes hacen envíos gratis arriba de 50 mil". Ahí es donde una IA sin fuente te dice que sí.
Las cuatro razones por las que inventa
| Razón | Qué la dispara | Cómo se corta |
|---|---|---|
| No tiene la información | Le preguntan algo que nunca le diste | Cargar el documento que la contiene |
| Tiene información vencida | El precio cambió y nadie actualizó la fuente | Mantener la fuente, no el prompt |
| El cliente afirma algo falso | "Me dijeron que…" | Instrucciones que la obliguen a chequear contra la fuente |
| No tiene permitido dudar | Se la diseñó para contestar siempre | Dejarla derivar a una persona |
Las cuatro son de configuración. Ninguna se arregla cambiando de modelo.
Qué lo corta de raíz
Tres cosas, en orden de impacto.
Una fuente propia. Si la respuesta sale de tus documentos, tu lista de precios y tus políticas, la IA no tiene que adivinar. Deja de generar una respuesta plausible y pasa a buscar el párrafo que contesta.
Un catálogo conectado. Los precios y el stock son el terreno donde inventar sale más caro. Cuando el número lo lee del sistema donde ya lo cargás, la IA no improvisa una cifra. Hoy esa conexión directa desde el panel es con Dux Software, y se van sumando más de a uno; con otro sistema, el respaldo sigue siendo el documento.
Una salida. Una IA que puede decir "esto lo ve una persona" inventa menos que una obligada a resolver todo. En un negocio que atendemos, alrededor del 50% de las conversaciones las resuelve la IA y cerca del 40% se derivan. Ese 40% no es una falla del sistema: es el sistema funcionando.
Cómo lo verificás vos
No hace falta confiar. Se prueba antes de que hable con nadie.
- Escribile una pregunta cuya respuesta esté en tus documentos. Tiene que citarla.
- Escribile una pregunta cuya respuesta no le diste. Tiene que decir que no la tiene, no aproximar.
- Afirmale algo falso como si fuera propio: "me dijeron que tienen 20% de descuento". Tiene que desmentirte.
La tercera es la que casi nadie corre, y es la que el estudio de Stanford señala como la más peligrosa.
Conclusiones
- El AI Index 2026 recoge un benchmark sobre 26 modelos top con tasas de error del 22% al 94%. Todos fallan.
- El benchmark no penaliza abstenerse, así que ese rango ya juega a favor de los modelos.
- La falla más grave aparece cuando el cliente afirma algo falso como propio: GPT-4o cayó de 98,2% a 64,4%.
- Inventar es casi siempre un problema de fuente, no de modelo.
- Una IA con documentos propios, catálogo conectado y permiso para derivar inventa mucho menos.
Preguntas frecuentes
- ¿Hay algún modelo de IA que no invente?
- No. El benchmark que recoge el AI Index 2026 cubrió 26 modelos de primera línea y el mejor todavía falla en el 22% de los casos.
- ¿Cargarle mis documentos elimina las alucinaciones?
- Las reduce mucho, porque la respuesta pasa a salir de un texto tuyo en vez de la memoria del modelo. No las elimina: por eso importa que pueda derivar a una persona.
- ¿Por qué la IA me dio la razón cuando le dije algo falso?
- Es el patrón que midió Stanford. Los modelos resisten bastante bien una afirmación falsa atribuida a un tercero, y ceden cuando el usuario la presenta como propia.
- ¿Cómo pruebo si la mía inventa antes de ponerla a atender?
- Preguntale algo que no le diste y fijate si dice que no sabe. Después afirmale algo falso y fijate si te lo discute.
Artículos relacionados
Lográ que tu equipo rinda el doble sin pedirles más
Atiende WhatsApp, Instagram y web. Aprende tu negocio, toma los pedidos y pasa a una persona cuando hace falta. Vos ves cada acción anotada en el chat.
Prueba gratis del plan Pro. Sin tarjeta de crédito.