Volver al blog
Por Alonso Grimaldo|||9 min de lectura

Por Qué Fallan los Proyectos de IA y Cómo Llevarlos a Producción

Los proyectos de inteligencia artificial fallan menos por el modelo y más por cómo se prueban: sin rediseñar el proceso, sin métrica de negocio, sin gobierno y sin calcular el costo de operar. Según McKinsey (agosto 2026), solo 37% de los encuestados atribuye algún impacto en EBIT a la IA, y en el Perú la mitad de las empresas sigue en piloto.

Inteligencia ArtificialEstrategiaPerú

La respuesta corta: por qué fallan los proyectos de inteligencia artificial

Los proyectos de inteligencia artificial fallan, sobre todo, porque se prueban como experimento tecnológico y no como cambio de proceso: nadie rediseña el flujo, nadie mide contra una línea base y nadie calcula cuánto cuesta operarlo. Según McKinsey (The state of AI in 2026, 25 de agosto de 2026), casi 9 de cada 10 encuestados reporta uso regular de IA, pero solo 37% le atribuye algún impacto en el EBIT, la misma proporción que en 2025.

En el Perú el cuello de botella es más visible. Según un estudio de Axpen (alianza de Apoyo Consultoría y Vinatea & Toyama) publicado por Gestión el 12 de mayo de 2026, 50% de las empresas sigue solo en fase piloto y apenas 10% integró la IA a procesos clave. El problema casi nunca es el modelo: es todo lo que lo rodea.

Abajo tienes los datos globales y peruanos más recientes, las 5 causas de fracaso que más se repiten, un caso real y un plan de 90 días para llevar tu piloto a producción o cancelarlo a tiempo, que también es un buen resultado.

Global vs Perú: los números de 2026 en una tabla

Los datos vienen de encuestas con muestras y metodologías distintas, así que léelos como tendencia y no como comparación exacta. Cuentan la misma historia: la IA ya está en casi todas partes, pero el impacto medible sigue concentrado en pocas empresas.

Ojo con la cifra más citada, el "95% de los pilotos fracasa" del MIT (Project NANDA, 2025): se presentó como hallazgos preliminares y su metodología está en disputa. Fortune reportó 150 entrevistas; Virtualization Review, 52 entrevistas y 153 encuestas; y Futuriom recogió pedidos de publicar los datos completos. Úsala como señal, no como estadística.

IA en empresas: dato global frente a dato peruano, con fuente y fecha
IndicadorGlobalPerúFuente y fecha
Uso de IA en empresasCasi 9 de cada 10 encuestados reporta uso regular en al menos una función51% de las empresas declaró que no usa IAMcKinsey (25 ago 2026); BCRP, ene 2026, vía Gestión (8 feb 2026)
Personas de 15 a 64 años que usan IA generativa17.8%16.4% (Colombia 24.5%, Chile 22.7%)Microsoft AI Economy Institute, Q1 2026 (mayo 2026)
Del piloto a la escala44% dice que la IA ya escala en toda la empresa (38% un año antes)50% sigue en piloto; 10% la integró a procesos claveMcKinsey (25 ago 2026); Axpen, vía Gestión (12 may 2026)
Para qué se usa56% usa IA en tres o más funciones del negocioDe las que usan IA: 66% para consultas tipo ChatGPT, 50% para optimizar procesos internosMcKinsey (25 ago 2026); BCRP, vía Gestión (8 feb 2026)
Impacto financiero37% atribuye algún impacto en EBIT; solo 6% son high performersSin dato público comparableMcKinsey (25 ago 2026)
Gobierno de la IAMás de dos tercios sin procesos para limitar la IA no autorizadaSolo 10% con políticas de IA aprobadas; 18% con protocolos de uso seguroIBM, vía Cybersecurity Dive (29 jul 2026); EY Perú (15 jun 2026)
Riesgo de seguridad43% de los incidentes involucró shadow AI (IA no autorizada)Sin dato público comparableIBM Cost of a Data Breach 2026, vía Cybersecurity Dive (29 jul 2026)
Expectativa del cliente87% considera esencial poder llegar a un humanoSin dato público comparableGartner (4 ago 2026)
Éxito de los pilotosCerca de 5% logra aceleración rápida de ingresos (preliminar y cuestionado)Sin dato público comparableMIT NANDA, vía Fortune (18 ago 2025)

Causas 1 y 2: IA pegada al proceso viejo y sin caso de negocio

Causa 1: se le pega IA al proceso viejo. El patrón típico es darle al equipo un chat de IA y esperar productividad, o poner un bot delante de un proceso que nadie rediseñó. Según el BCRP (enero 2026), entre las empresas peruanas que usan IA, 66% la usa para consultas tipo ChatGPT o Copilot. Eso ayuda a la persona, pero no cambia el proceso.

La evidencia de McKinsey (agosto 2026) es directa: casi tres cuartos de los high performers rediseñaron de forma fundamental sus flujos de trabajo por la IA (55% un año antes), frente a solo un cuarto del resto. Quien captura valor cambia quién hace qué, en qué orden y con qué datos. El resto automatiza el desorden.

Causa 2: no hay caso de negocio, ni línea base ni costo de operar. Muchos pilotos arrancan con un "probemos la IA" y terminan en una demo que nadie puede defender en un comité, porque no se midió el antes. Según McKinsey, los high performers duplican al resto en tener procesos definidos para medir el impacto de la IA.

El otro lado del caso de negocio es el costo. Uno de cada cinco encuestados por McKinsey dice que su organización limita el uso de IA por los costos de operación, incluidos los tokens. Y Gartner (junio 2025) proyectó que más de 40% de los proyectos de IA agéntica serán cancelados a fines de 2027 por costos crecientes, valor de negocio poco claro o controles de riesgo insuficientes.

Causas 3, 4 y 5: datos crudos, IA sin gobierno y el humano fuera del circuito

Causa 3: se culpa al modelo cuando el problema son los datos y el diseño. Ante un piloto que no funciona, la reacción habitual es cambiar de modelo o de proveedor. Según la cobertura de Fortune (agosto 2025) del estudio del MIT, el problema no es la calidad de los modelos sino la integración con el flujo de la empresa. Con la salvedad metodológica ya dicha, coincide con la práctica: el modelo decide según lo que le entregas.

Causa 4: nadie gobierna el uso y la IA entra por la puerta de atrás. Según EY Perú (15 de junio de 2026), solo 10% de las empresas peruanas tiene políticas de IA aprobadas y apenas 18% cuenta con protocolos de uso seguro y ético. Mientras tanto, los equipos ya usan herramientas por su cuenta.

Eso tiene un costo. Según Cybersecurity Dive (29 de julio de 2026), el informe Cost of a Data Breach 2026 de IBM encontró que 43% de los incidentes de seguridad involucró shadow AI, más del doble que el año anterior, y que más de dos tercios de las organizaciones no tiene procesos para limitarla. Un piloto sin permisos, registros ni política de datos no pasa una revisión seria de riesgo.

Causa 5: se saca al humano del circuito demasiado pronto. Según Gartner (4 de agosto de 2026), 87% de los clientes considera esencial poder llegar a un agente humano cuando la empresa usa IA generativa en atención, y la firma recomienda no convertirla en paso obligatorio para todo. Lo que funciona: la IA resuelve lo que tiene alta confianza y deriva el resto a una persona, con el contexto ya armado.

Un ejemplo real: 763 ciclos en "hold" y el diagnóstico que lo resolvió

En Jev Lab, un laboratorio interno de Latech, un agente de IA evalúa precios de mercado en tiempo real cada pocos minutos y decide si comprar, vender o mantener, con un capital virtual de 100 USD (simulación, sin dinero real). Durante 763 ciclos con tres activos, el modelo nunca salió de "hold": la probabilidad de mantener nunca bajó de 0.69 y la de comprar nunca pasó de 0.28.

La tentación era culpar al modelo. El diagnóstico mostró otra cosa: le pasábamos 30 cotizaciones crudas de un minuto, y el movimiento típico en 30 minutos (mediana entre 0.26% y 0.35%) era del mismo tamaño que el costo simulado de entrar y salir (0.30%). Con ese ruido, no hacer nada era la respuesta racional.

Había un segundo problema: con unos 0.52 USD diarios de costo estimado de IA, el experimento habría tocado su límite de pérdida de 90 USD en unos 19 días sin operar ni una vez. La corrección no fue cambiar de modelo sino el insumo: calcular en código indicadores horarios y entregar un estado compacto. El pedido bajó de 8,583 tokens para tres activos a 4,598 para seis.

En el primer periodo en vivo con la nueva versión, el modelo eligió comprar en cuatro de seis activos y solo uno superó el umbral de confianza de 0.7, lo que generó la primera operación simulada. Es una observación, no una prueba de rentabilidad. Lo valioso es el método: el diagnóstico fue posible porque cada pedido, respuesta y probabilidad quedaba registrado. El caso completo está en el artículo de Jev Lab.

Plan de 90 días para llevar un piloto de IA a producción

El plan asume un solo proceso, un dueño de negocio con poder de decisión y acceso a los sistemas donde vive la información. Si falta alguno, resuélvelo antes de escribir código. Los plazos son un supuesto de diseño para un proceso acotado; uno regulado o con muchas integraciones puede necesitar más.

  1. Semanas 1 y 2, proceso y métrica: elige un proceso con volumen y un dolor medible, como la respuesta a consultas o la clasificación de documentos. Mide la línea base (volumen, tiempo por caso, costo y tasa de error) y deja por escrito el umbral de éxito, el de cancelación y el costo máximo aceptable por transacción.
  2. Semanas 3 a 6, piloto en producción acotado: nada de demos aparte. Conecta el piloto a los sistemas reales (ERP, CRM, WhatsApp) con un segmento limitado, por ejemplo una sede, un tipo de caso o una parte del volumen. Mientras se calibra, una persona revisa las salidas antes de que lleguen al cliente.
  3. Semanas 7 a 10, guardrails y observabilidad: registra cada entrada, salida, nivel de confianza, costo y latencia. Define el umbral de confianza por debajo del cual el caso pasa a un humano, permisos mínimos por rol y una política de datos. Revisa los errores cada semana y corrige primero datos y reglas, después el modelo.
  4. Semanas 11 a 13, escalar o matar: compara contra la línea base con los criterios que firmaste en la semana 1. Si pasa, amplía al siguiente segmento con el mismo tablero. Si no pasa, cancélalo y documenta por qué. Un piloto cancelado a tiempo cuesta mucho menos que uno que pasa años en el limbo.

Señales de que tu piloto de IA va camino al cajón

Si reconoces dos o más de estas señales, tu piloto probablemente fallará por diseño y no por tecnología, y todo se puede corregir antes de invertir más. La ventana sigue abierta: según Microsoft (mayo 2026), 16.4% de los peruanos de 15 a 64 años usó IA generativa en el primer trimestre de 2026, menos que el promedio mundial (17.8%), Colombia o Chile. Pasar a producción ahora todavía es llegar antes que buena parte del mercado.

  • Nadie puede decir en una frase qué métrica de negocio debe mover el piloto ni cuánto vale hoy.
  • El piloto vive en una demo o en una hoja aparte, sin conexión con el ERP, el CRM o el canal real.
  • No sabes cuánto cuesta cada conversación, documento o decisión procesada.
  • No hay registro de qué recibió el modelo y qué respondió, así que cada error se discute de memoria.
  • No existe una salida clara hacia una persona cuando la IA no tiene confianza suficiente.
  • La única respuesta a los malos resultados es "probemos otro modelo".
  • No hay una política aprobada sobre qué datos pueden usarse y con qué herramientas.

Fuentes y referencias

Preguntas frecuentes

¿Qué porcentaje de los proyectos de IA fracasa?

No hay una cifra única confiable. El MIT NANDA (2025) dice que cerca de 5% de los pilotos logra una aceleración rápida de ingresos, pero es un estudio preliminar y cuestionado. Más sólido: McKinsey (agosto 2026) encontró que solo 37% de los encuestados atribuye algún impacto en EBIT a la IA y apenas 6% son high performers. En el Perú, 50% de las empresas sigue en piloto (Axpen, mayo 2026).

¿Cuánto debe durar un piloto de IA antes de decidir si se escala?

Como supuesto de diseño, 90 días alcanzan para un proceso acotado: dos semanas para medir la línea base, cuatro de piloto en producción con volumen limitado, cuatro para guardrails y observabilidad, y tres para decidir. Más que el plazo exacto, importa fijar desde el primer día los criterios de éxito y de cancelación. Un piloto sin fecha de decisión tiende a quedarse en el limbo.

¿Conviene cambiar de modelo de IA si el piloto no da resultados?

Casi nunca es lo primero. Antes revisa qué datos recibe el modelo, cómo están formulados los pedidos, qué umbrales usas y cómo validas las respuestas. En Jev Lab, un laboratorio interno de Latech, un agente pasó 763 ciclos sin salir de "hold" porque recibía datos crudos y ruidosos; se corrigió calculando indicadores en código, no cambiando de modelo. Sin registros de cada entrada y salida, ese diagnóstico es imposible.

Soluciones relacionadas

También te puede interesar

Si tienes un piloto de IA estancado, o quieres empezar uno con métrica, costos y salida a producción definidos desde el primer día, conversemos. En Latech revisamos tu proceso y te decimos con franqueza si conviene escalar, rediseñar o cancelar.

Háblanos por WhatsApp