← Volver al blog
Agentes de IA

Los modelos top fallan entre 22% y 94% en exactitud: por qué tu IA inventa y qué lo corta

Publicado el 18 de agosto de 2026Por Brian Sasbon4 min de lectura

La respuesta corta

Una IA inventa cuando no tiene de dónde sacar la respuesta y aun así contesta. Por qué la IA inventa respuestas tiene menos que ver con qué modelo usás que con si le diste una fuente y si la dejaste decir "no sé".

Y el problema es más grande de lo que sugiere el marketing de los modelos. El AI Index 2026 de Stanford recoge un benchmark hecho sobre 26 modelos de primera línea, con tasas de error que van del 22% al 94%.

Qué se midió, y cómo

El benchmark, llamado AA-Omniscience, toma 6.000 preguntas repartidas en seis dominios, de derecho y salud a matemática e ingeniería de software.

El detalle que lo hace útil está en cómo puntúa: suma por responder bien, resta por responder mal, y no penaliza abstenerse. O sea, premia al modelo que dice que no sabe.

Aun con ese incentivo a favor, el rango va de 22% a 94% según el modelo. No hay un modelo que no falle. Hay modelos que fallan menos.

El hallazgo que importa para atención al cliente

Este es el que cambia cómo diseñás la atención, y casi nadie lo cuenta.

Los modelos se derrumban cuando la afirmación falsa viene del propio usuario. Cuando la misma afirmación falsa se presenta como algo que cree un tercero, el modelo la resiste bastante bien. Cuando el usuario la presenta como propia, el modelo cede.

En el estudio, la exactitud de GPT-4o cayó de 98,2% a 64,4% con ese solo cambio. DeepSeek R1 cayó de más del 90% a 14,4%.

Traducido a tu WhatsApp: el riesgo no es el cliente que pregunta algo raro. Es el cliente que escribe "me dijeron que ustedes hacen envíos gratis arriba de 50 mil". Ahí es donde una IA sin fuente te dice que sí.

Las cuatro razones por las que inventa

RazónQué la disparaCómo se corta
No tiene la informaciónLe preguntan algo que nunca le disteCargar el documento que la contiene
Tiene información vencidaEl precio cambió y nadie actualizó la fuenteMantener la fuente, no el prompt
El cliente afirma algo falso"Me dijeron que…"Instrucciones que la obliguen a chequear contra la fuente
No tiene permitido dudarSe la diseñó para contestar siempreDejarla derivar a una persona

Las cuatro son de configuración. Ninguna se arregla cambiando de modelo.

Qué lo corta de raíz

Tres cosas, en orden de impacto.

Una fuente propia. Si la respuesta sale de tus documentos, tu lista de precios y tus políticas, la IA no tiene que adivinar. Deja de generar una respuesta plausible y pasa a buscar el párrafo que contesta.

Un catálogo conectado. Los precios y el stock son el terreno donde inventar sale más caro. Cuando el número lo lee del sistema donde ya lo cargás, la IA no improvisa una cifra. Hoy esa conexión directa desde el panel es con Dux Software, y se van sumando más de a uno; con otro sistema, el respaldo sigue siendo el documento.

Una salida. Una IA que puede decir "esto lo ve una persona" inventa menos que una obligada a resolver todo. En un negocio que atendemos, alrededor del 50% de las conversaciones las resuelve la IA y cerca del 40% se derivan. Ese 40% no es una falla del sistema: es el sistema funcionando.

Cómo lo verificás vos

No hace falta confiar. Se prueba antes de que hable con nadie.

  1. Escribile una pregunta cuya respuesta esté en tus documentos. Tiene que citarla.
  2. Escribile una pregunta cuya respuesta no le diste. Tiene que decir que no la tiene, no aproximar.
  3. Afirmale algo falso como si fuera propio: "me dijeron que tienen 20% de descuento". Tiene que desmentirte.

La tercera es la que casi nadie corre, y es la que el estudio de Stanford señala como la más peligrosa.

Conclusiones

  • El AI Index 2026 recoge un benchmark sobre 26 modelos top con tasas de error del 22% al 94%. Todos fallan.
  • El benchmark no penaliza abstenerse, así que ese rango ya juega a favor de los modelos.
  • La falla más grave aparece cuando el cliente afirma algo falso como propio: GPT-4o cayó de 98,2% a 64,4%.
  • Inventar es casi siempre un problema de fuente, no de modelo.
  • Una IA con documentos propios, catálogo conectado y permiso para derivar inventa mucho menos.

Preguntas frecuentes

¿Hay algún modelo de IA que no invente?
No. El benchmark que recoge el AI Index 2026 cubrió 26 modelos de primera línea y el mejor todavía falla en el 22% de los casos.
¿Cargarle mis documentos elimina las alucinaciones?
Las reduce mucho, porque la respuesta pasa a salir de un texto tuyo en vez de la memoria del modelo. No las elimina: por eso importa que pueda derivar a una persona.
¿Por qué la IA me dio la razón cuando le dije algo falso?
Es el patrón que midió Stanford. Los modelos resisten bastante bien una afirmación falsa atribuida a un tercero, y ceden cuando el usuario la presenta como propia.
¿Cómo pruebo si la mía inventa antes de ponerla a atender?
Preguntale algo que no le diste y fijate si dice que no sabe. Después afirmale algo falso y fijate si te lo discute.

Artículos relacionados

Empezar

Lográ que tu equipo rinda el doble sin pedirles más

Atiende WhatsApp, Instagram y web. Aprende tu negocio, toma los pedidos y pasa a una persona cuando hace falta. Vos ves cada acción anotada en el chat.

Prueba gratis del plan Pro. Sin tarjeta de crédito.

Escribinos por WhatsApp