---
title: "El bot de TurboTax falló más de la mitad de las preguntas fiscales"
description: "El bot de TurboTax falló más de la mitad de las preguntas fiscales y el de H&R Block un 30% en la prueba del Washington Post. Qué falló y cómo evitarlo."
slug: "chatbot-turbotax-fallo-mitad-preguntas-fiscales"
url: "https://catalizadora.ai/blog/chatbot-turbotax-fallo-mitad-preguntas-fiscales"
cluster: "casos-ia"
author: "Pablo Estrada"
published_at: "2026-08-26T08:03:57.056+00:00"
updated_at: "2026-08-27T16:06:03.646055+00:00"
read_minutes: "7"
lang: "es"
---
# El bot de TurboTax falló más de la mitad de las preguntas fiscales

> El bot de TurboTax falló más de la mitad de las preguntas fiscales y el de H&R Block un 30% en la prueba del Washington Post. Qué falló y cómo evitarlo.

## La cronología

**Día 0.** Temporada fiscal de 2024 en Estados Unidos. Intuit, dueña de TurboTax, y H&R Block —las dos marcas más reconocibles del negocio de preparar declaraciones de impuestos en ese país— colocan asistentes de inteligencia artificial generativa frente al contribuyente, dentro del mismo flujo en el que la persona está armando su declaración. La promesa es de las que se venden solas: en lugar de leer un instructivo del IRS escrito para contadores, pregunta en tu idioma y recibí una respuesta en dos segundos.

**Día 1.** El 4 de marzo de 2024, el Washington Post publica el resultado de haber hecho exactamente eso, pero en serio: someter a los dos asistentes a preguntas fiscales reales y llevar sus respuestas a asesores fiscales para que las calificaran. El asistente de TurboTax falló más de la mitad de las preguntas. El de H&R Block, alrededor del 30%. Entre los errores concretos que quedaron documentados: recomendar declarar en dos estados cuando correspondía uno solo, y describir mal las reglas del IRS sobre criptomonedas.

**Horas y días después.** El calendario fiscal no se detiene por una nota de prensa. La cobertura no registra que ninguna de las dos empresas haya apagado su asistente; los productos siguieron su curso hacia la fecha límite de abril. Vale la pena notar la ironía operativa: ambas compañías venden, además del software, acceso a preparadores humanos. Existía una ruta de salida para toda pregunta que el bot no podía sostener, y esa ruta no se activó. Lo que quedó publicado —más de la mitad de las respuestas incorrectas o inútiles— sobrevivió a la temporada.

> Nadie midió la tasa de error de esos asistentes antes de ponerlos frente al contribuyente; la midió un periódico, después, y el número se volvió la noticia.

## Qué pasó, en detalle

Lo primero que conviene entender de esta prueba es que no fue una cacería de respuestas absurdas. El Post no buscó preguntas trampa ni casos de laboratorio: preguntó lo que pregunta una persona normal cuando está a mitad de su declaración. Y no calificó las respuestas por su cuenta: las puso frente a asesores fiscales, es decir, contra el criterio profesional que la empresa dice estar reemplazando o complementando.

La métrica tampoco fue "alucinación" en abstracto. Fue *incorrecta o inútil*, que en atención al cliente es la categoría honesta: agrupa tanto la respuesta equivocada como la respuesta que suena bien, no dice nada y devuelve al usuario al punto de partida. Con ese criterio, más de la mitad de lo que produjo el asistente de TurboTax no servía. Uno de cada tres del de H&R Block, tampoco.

Los dos ejemplos concretos que dejó la nota son distintos entre sí y por eso valen doble. Recomendar declarar en dos estados cuando tocaba uno es un error de aplicación: la regla general puede ser correcta, pero no era la regla de esa persona, y el sistema no tenía —o no usó— los datos que hacían la diferencia. Describir mal las reglas del IRS sobre criptomonedas es un error de fuente: el sistema respondió sobre normativa específica y cambiante con un promedio de todo lo que alguna vez se escribió en internet sobre el tema.

Lo que une a los dos casos es el tono. Los errores no llegaban con dudas ni con matices; llegaban con la misma seguridad que las respuestas buenas. En un dominio donde equivocarse puede terminar en una auditoría, la confianza uniforme es parte del daño. [Cobertura en The Washington Post](https://www.washingtonpost.com/technology/2024/03/04/ai-taxes-turbotax-hrblock-chatbot/).

## Los números

- **1.800** — empleados despedidos por Intuit, 10% de la plantilla, para acelerar su apuesta de IA
- **+50%** — de las 16 preguntas de impuestos del Post las respondió mal el bot de TurboTax
- **25%** — seguía fallando el bot DESPUÉS de que Intuit lo corrigiera por el reclamo del Post
- **+30%** — de las respuestas del bot de H&R Block fueron inútiles o directamente falsas

*Verificado contra [arstechnica.com](https://arstechnica.com/information-technology/2024/07/intuits-ai-gamble-mass-layoff-of-1800-paired-with-hiring-spree/).*

## Por qué pasó

No sabemos cómo estaban armados esos asistentes por dentro, y no hace falta saberlo para reconocer el patrón. Este tipo de resultado no lo produce un modelo malo: lo produce un proceso al que le faltan cuatro piezas.

**Falta el ancla.** Un modelo generativo sin una fuente conectada responde desde su memoria estadística, que es el promedio del texto que vio durante su entrenamiento. Para casi todo, ese promedio alcanza. Para materia tributaria, es exactamente el peor insumo posible: las reglas cambian por año, por jurisdicción y por situación personal, y el internet histórico está lleno de versiones viejas de todas ellas. Un sistema anclado busca primero en el texto normativo vigente y redacta después; uno sin ancla redacta directamente.

**Falta el borde.** Un chat abierto acepta infinitas preguntas; cualquier prueba de calidad cubre una lista finita. Cuando no se declara por escrito qué temas contesta el asistente, se promete implícitamente que contesta todo. La superficie de entrada quedó sin límite, y lo que no tiene límite no se puede probar.

**Falta la tercera respuesta.** Entre "correcto" e "incorrecto" tiene que existir "no sé, te paso con alguien". Sin esa ruta implementada como mecanismo —no como sugerencia en el prompt—, toda incertidumbre interna del modelo se convierte en prosa segura de salida. El sistema no puede callarse porque nadie le construyó la opción de callarse.

**Falta el número.** La tasa de error existía antes de la publicación. Simplemente nadie la había medido, o nadie la había puesto como condición para lanzar. El Post no descubrió una falla nueva: publicó una métrica que debía ser interna.

Con el mismo modelo, conectado al texto vigente, con un alcance declarado y una ruta de escalada, la nota habría dicho otra cosa: que el asistente contesta bien un conjunto acotado de preguntas y deriva el resto. Menos espectacular, infinitamente más defendible.

![Gráfico con las tasas de error de los asistentes de TurboTax y H&R Block medidas por el Washington Post](/img/casos/chatbot-turbotax-fallo-mitad-preguntas-fiscales-datos.jpg)

*Más de la mitad de las respuestas del asistente de TurboTax fueron incorrectas o inútiles; el de H&R Block falló cerca del 30%, según la prueba del Washington Post con asesores fiscales.*

## Dónde te puede pasar a ti

No hace falta operar en 50 estados ni facturar millones para reproducir este caso. La versión de una empresa mediana de LATAM se ve así:

- **El bot de atención responde sobre impuestos, facturación electrónica o requisitos regulatorios** porque el cliente pregunta y el bot no sabe negarse. Un dato desactualizado sobre retenciones, régimen tributario o requisitos de aduana sale con la misma seguridad que el horario de atención.
- **El bot de ventas cotiza de memoria.** Arma un precio, un plazo de entrega o un descuento que no salió de ninguna tabla. El cliente toma captura de pantalla, y esa captura funciona como compromiso comercial aunque el sistema interno diga otra cosa.
- **El asistente interno de recursos humanos contesta sobre prestaciones, vacaciones o liquidación.** Acá no hay reclamo en redes sociales: hay un empleado con una respuesta por escrito de la empresa y un abogado laboral disponible.
- **El contenido generado publica una cifra normativa vieja** en el blog o en la ficha de producto, y ese texto queda indexado durante meses respondiendo por la marca ante quien lo busque en Google.

La pregunta incómoda es sencilla y casi nadie la puede contestar hoy: ¿cuál es la tasa de error de tu bot esta semana, y quién la midió? Si la respuesta es "no hemos recibido quejas", no tienes una medición. Tienes un silencio, que es otra cosa.

## Cómo se evita

**1. Declarar el alcance por escrito y cerrar el resto.** Una lista explícita de temas que el asistente contesta. Todo lo que no está en la lista se deriva, sin excepciones y sin intentar ser útil. Lo no declarado no existe: esa es la regla, y se implementa en código, no en el instructivo del modelo.

**2. Anclar cada respuesta a una fuente citable.** El asistente busca en el corpus del cliente —tablas de precios, políticas, normativa vigente— y responde solo sobre lo que encontró, mostrando de dónde salió. Sin fuente recuperada, no hay respuesta: hay derivación. Esto elimina de un golpe la categoría entera de errores de memoria.

**3. Medir la tasa de error antes de lanzar, con el experto del dominio.** Cien a doscientas preguntas reales, tomadas del historial de atención, respondidas por el bot y calificadas por quien sabe del tema —el contador, el abogado, el jefe de operaciones—. El umbral de aprobación se define antes de ver los resultados. Es exactamente lo que hizo el Washington Post; la única diferencia es quién lo hace primero.

**4. Construir la escalada como mecanismo, no como buena intención.** Señales concretas que disparan el paso a humano: baja confianza en la recuperación, tema regulado, monto por encima de un límite, cliente molesto, segunda repregunta sobre lo mismo. El bot debe poder decir "esto lo ve una persona" sin que eso cuente como fracaso.

**5. Muestrear producción todas las semanas.** Un lote de conversaciones reales revisadas contra el mismo criterio de la prueba inicial. La tasa de error no es un número de lanzamiento: se mueve cuando cambia el catálogo, la normativa o el modelo, y solo se entera quien la vigila.

## Cómo lo hacemos en Catalizadora

En **Cortex**, nuestro motor conversacional, los precios y las condiciones salen de las tablas del cliente, nunca de la memoria del modelo: el *price-guard* bloquea la respuesta si el dato no vino de la base. Las capacidades del bot están declaradas de forma explícita —lo que no está declarado, no existe— y la escalada a humano se dispara por señales, no por criterio del modelo. Un asistente Cortex puesto sobre materia fiscal contestaría lo que está en el documento del cliente y derivaría el resto; no tendría manera de improvisar una regla del IRS.

En **Atlas** queda el registro completo e inalterable de cada conversación. Cuando alguien reclama por una respuesta, no hay debate sobre qué dijo el bot: está la conversación textual, con fecha, con la fuente que usó. Esa es la diferencia entre auditar un incidente en veinte minutos y discutirlo durante semanas.

Y en **Faro**, el tablero del cliente, la tasa de intervención humana está a la vista todo el tiempo. Si sube, algo cambió: el catálogo, la normativa, el tipo de consulta. Es la métrica que nadie tenía en marzo de 2024.

**La regla, en una línea: si el asistente no puede citar de dónde salió la respuesta, no la da; la deriva.**

---

*Este es uno de los casos documentados en nuestra hemeroteca de fallas de IA. Todos con su fuente enlazada, y todos con la misma conclusión: el problema casi nunca es el modelo.*
## Preguntas frecuentes

### ¿Qué pasó después con los asistentes de TurboTax y H&R Block?

La cobertura del Washington Post, publicada el 4 de marzo de 2024, no registra que ninguna de las dos empresas haya retirado su asistente tras la prueba; la temporada fiscal siguió su curso hacia la fecha límite de abril. Lo que quedó publicado y permanente es la medición: más de la mitad de las respuestas de TurboTax fueron incorrectas o inútiles, y cerca del 30% de las de H&R Block.

### ¿Significa esto que la IA generativa no sirve para atención al cliente?

No. Significa que un modelo respondiendo desde su memoria, sin fuente conectada y sin alcance declarado, no sirve para dominios con consecuencias legales. El mismo modelo, anclado a los documentos vigentes del cliente y con una ruta de escalada a humano, responde bien un conjunto acotado de preguntas y deriva el resto. El problema fue el proceso de lanzamiento, no la tecnología.

### ¿Cómo se mide la tasa de error de un bot antes de lanzarlo?

Se toman entre cien y doscientas preguntas reales del historial de atención, se le pasan al asistente y se hacen calificar por el experto del dominio: el contador, el abogado o el jefe de operaciones, según el tema. El umbral de aprobación se define antes de ver los resultados. Es el mismo ejercicio que hizo el Washington Post; la única diferencia es hacerlo antes que el periodista.

### Si el bot de mi empresa da un dato equivocado, ¿quién responde?

Comercialmente responde la empresa que publicó el bot: para el cliente, esa respuesta es la posición oficial de la marca y suele quedar en una captura de pantalla. En el caso fiscal estadounidense la responsabilidad formal recae además en quien firma la declaración, lo que agrava el problema para el usuario. Por eso conviene registrar cada conversación de forma inalterable y limitar por diseño lo que el bot puede afirmar.


---

Source: https://catalizadora.ai/blog/chatbot-turbotax-fallo-mitad-preguntas-fiscales
Author: Pablo Estrada — AI Catalysts, LLC (catalizadora.ai)
