La evidencia acumulada en 2025-2026

El optimismo corporativo sobre agentes de IA choca con datos cada vez más consistentes en dirección contraria. En noviembre de 2025, el Wall Street Journal reportó que "pocas empresas que desplegaron agentes de IA han recibido un retorno de la inversión". Un mes antes, The Information había documentado una caída en las expectativas de capacidad de IA entre empresas que ya venían usando agentes en producción.

Un estudio de Carnegie Mellon fue todavía más contundente: en un entorno de negocio simulado, ninguno de los agentes evaluados pudo completar la mayoría de las tareas asignadas — incluyendo fallas documentadas con agentes como Devin AI en configuraciones de trabajo freelance y empresarial formal.

0Agentes que completaron la mayoría de tareas (estudio CMU)
Expectativas de capacidad, oct. 2025 (The Information)
PocasEmpresas con ROI confirmado (WSJ, nov. 2025)

Los despidos que sí pasaron — y lo que revelan

Salesforce, Klarna e IBM anunciaron reducciones de personal en 2025, reemplazando cientos de puestos de atención al cliente y recursos humanos con agentes de IA. El caso de Klarna es el más citado: la empresa sueca reemplazó cientos de agentes humanos de soporte, pero terminó recontratando a parte de ese personal tras detectar caídas en la calidad de atención que el agente no lograba resolver.

Este patrón —reemplazo agresivo seguido de retracción parcial— es la evidencia más clara de que los agentes de IA hoy funcionan bien en un subconjunto acotado de interacciones (consultas simples, repetitivas, de bajo riesgo) pero fallan al escalar a la variedad completa de casos que maneja un equipo humano experimentado.

Dónde sí hay evidencia real de funcionamiento

La adopción empresarial de agentes en 2025-2026 se concentró, con razón, en dos áreas donde la evidencia de valor es más sólida:

  • Agentes de coding: el caso de uso con mayor consenso de valor real, especialmente para refactors, generación de tests y debugging asistido — tareas con criterio de éxito objetivamente verificable (el código compila, los tests pasan).
  • Soporte al cliente de primer nivel: funciona bien para consultas de alto volumen y baja complejidad (estado de pedido, preguntas frecuentes, reset de contraseña), con degradación notable en casos que requieren juicio o empatía genuina.
El patrón común de los casos exitosos: todos comparten una característica — el criterio de "tarea completada correctamente" es objetivo y verificable automáticamente. Donde el éxito depende de juicio subjetivo o manejo de excepciones no anticipadas, los agentes siguen fallando de forma sistemática.

Qué implica esto para una decisión de inversión en agentes hoy

La recomendación que emerge de toda esta evidencia no es "no invertir en agentes" sino "invertir donde el criterio de éxito es verificable y las consecuencias de un error son reversibles". Antes de reemplazar un rol humano completo con un agente, la pregunta correcta es: ¿puedo verificar automáticamente si el agente hizo bien su trabajo, y qué pasa si falla?

Para flujos de negocio con alto riesgo reputacional o financiero por error (comunicación directa con clientes de alto valor, decisiones financieras, contenido público de marca), mantener supervisión humana en el loop —no reemplazo total— sigue siendo la estrategia con mejor evidencia de resultado hasta que la tecnología cierre la brecha de confiabilidad que estos estudios documentan.