Saltar al contenido principal
Volver a la biblioteca

En qué nos equivocamos sobre los agentes este año

Un año de agentes en producción, una industria discutiendo con estadísticas que nunca verificó y varias predicciones confiadas que no sobrevivieron. Incluidas algunas mías.

aiagentesretrospectivaevidenciaoperacionesestrategia

Puntos clave

  • Las dos estadísticas más citadas sobre el fracaso de la AI no dicen lo que la gente cree. Vale la pena leer ambas en la fuente.
  • Un famoso estudio de productividad fue retirado por quienes lo hicieron. Así se ve la integridad.
  • Los pronósticos de los analistas se contradijeron entre sí en menos de ocho meses. Cita la encuesta, no la predicción.
  • Lo autónomo no le ganó a lo supervisado en capacidad. Le ganó en atención, que es otro argumento.
  • Los despliegues que funcionaron fueron acotados, medidos y aburridos.

Ha pasado un año desde que los agentes dejaron de ser una demo y empezaron a ser algo que las empresas de verdad operan. Tiempo suficiente para ver qué se sostuvo.

Escribo esto como una lista de correcciones y no como una vuelta de la victoria, incluso sobre cosas que yo dije. El resultado útil de un año no es una tesis confirmada. Es la lista de lugares donde la evidencia fue para otro lado.

El 95 por ciento que todo el mundo citó

Ya lo viste. El noventa y cinco por ciento de los pilotos de AI fracasan.

El informe dice algo distinto. Dice que el 95 por ciento de las organizaciones está obteniendo cero retorno, lo cual es una afirmación sobre todas las organizaciones, no sobre los pilotos. Su propio embudo tiene a la mitad de las organizaciones investigando, al 20 por ciento haciendo pilotos y al 5 por ciento implementando, lo que significa que aproximadamente una cuarta parte de los pilotos superó la vara. La base de evidencia son 52 entrevistas y 153 respuestas de encuesta recogidas en conferencias durante seis meses, etiquetadas como preliminares, sin revisión por pares, y los propios autores advierten que seis meses pueden subestimar las tasas de éxito. (crítica, abril de 2026)

Un número le dio la vuelta al mundo porque confirmaba algo que la gente ya quería decir. Yo lo cité en conversaciones más de una vez antes de leer la metodología. Eso es culpa mía.

El pronóstico del 40 por ciento de cancelaciones

La otra: el 40 por ciento de los proyectos de AI agéntica serán cancelados para 2027.

La base declarada es una encuesta de enero de 2025 a 3.412 asistentes a un webinar que se autoseleccionaron, y mide la postura de inversión, no cancelaciones. Es juicio de analista. Puede resultar cierto. No es una medición, y se cita como si lo fuera.

Vale la pena poner sobre la mesa el historial de pronósticos de esa misma firma este año, porque muestra lo rápido que cambió la narrativa. En agosto de 2025 proyectó que el 40 por ciento de las aplicaciones empresariales estarían integradas con agentes específicos para tareas a finales de 2026, frente a menos del 5 por ciento. En abril de 2026 su propia encuesta a CIOs encontró que el 17 por ciento de las organizaciones había desplegado agentes, y ubicó a la AI agéntica en el pico de expectativas infladas. (Gartner, abril de 2026)

Ocho meses de diferencia. La misma firma. La encuesta es útil. El pronóstico era un estado de ánimo.

El estudio de productividad que fue retirado

A comienzos del año, el resultado más citado en la discusión sobre herramientas para desarrolladores era un ensayo aleatorizado que sugería que los desarrolladores experimentados de código abierto eran 19 por ciento más lentos cuando usaban herramientas de AI.

METR, la organización que lo hizo, ahora tiene un aviso en esa página que dice que los resultados están desactualizados, y publicó en febrero de 2026 un seguimiento con 57 desarrolladores en 143 repositorios y más de 800 tareas, donde el signo se invirtió pero ambos brazos cruzan el cero. (METR, febrero de 2026)

Así que hoy no se puede defender ni la desaceleración ni una aceleración. Respeto eso mucho más de lo que respetaría una actualización confiada. Si usaste la cifra del 19 por ciento en una presentación, ahora necesita una nota al pie.

Lo que la autonomía midió en realidad

El resultado más sorprendente del año, para mí, fue sobre la aprobación humana y no sobre la capacidad de los modelos.

En un estudio controlado con 1.053 evaluadores pagados, un sistema automatizado de permisos detectó el 89 por ciento de los comandos peligrosos, mientras que los evaluadores humanos detectaron el 13,6 por ciento, y la tasa de detección humana se deterioró dentro de una misma sesión, de alrededor del 17 por ciento al principio a cerca del 5 por ciento después de cincuenta o más prompts previos. Se reportó que la aprobación manual tenía más del doble de probabilidad que el modo automatizado de terminar en acciones dañinas que los usuarios no habían pedido. El modo automatizado se volvió el predeterminado en agosto. (Anthropic, agosto de 2026)

Pasé la primera mitad del año argumentando que una decisión humana debía estar antes de las acciones con consecuencias. Todavía lo creo para acciones irreversibles y de alto valor. En lo que me equivoqué fue en suponer que el humano en esa posición estaba haciendo el trabajo. Con volumen, no lo hace, y un control automático bien diseñado lo supera.

La corrección no es menos supervisión. Es supervisión en menos lugares, con mejor contexto, en las acciones que de verdad la merecen. La política se encarga de los casos rutinarios para que a la persona le quede atención para el caso raro.

Advertencia, otra vez: al proveedor le conviene esta conclusión. El diseño del estudio es público, la muestra es grande y nadie ha producido una medición contraria de escala similar. Tómalo en serio y mantente atento a una refutación.

La capacidad no llegó como decían las hojas de ruta

Las cifras de los benchmarks son un buen antídoto contra las charlas de conferencia.

En TheAgentCompany, un benchmark de tareas realistas de empresa, la mejor tasa de finalización autónoma es 42,86 por ciento, y la tabla de clasificación no tiene envíos de 2026 por encima de esa cifra. En tau-bench, un benchmark de servicio al cliente, un agente con más del 60 por ciento de éxito promedio por tarea cae por debajo del 25 por ciento cuando la misma tarea tiene que resolverse correctamente ocho veces seguidas. El techo de SWE-bench Verified es 79,2 por ciento, no los noventa y tantos que circulan en blogs agregadores.

Ese colapso de confiabilidad bajo repetición es el número que yo pondría en la pared. El éxito promedio es una estadística de demo. La consistencia en intentos repetidos es la estadística de producción, y es mucho más baja.

La historia laboral también se corrigió

Varias empresas que atribuyeron públicamente recortes de personal a la AI han reversado parte de eso. Un trabajo de encuestas reportado en julio de 2026 encontró que el 39 por ciento de los líderes había hecho despidos impulsados por la AI y que el 55 por ciento de ellos ahora dice que fue la decisión equivocada, con alrededor del 32 por ciento de los gerentes de contratación en Estados Unidos reportando que eliminaron un cargo por la AI y luego volvieron a contratar.

El ejemplo más citado es más enredado que la versión resumida. El propio informe anual de la empresa reporta una caída de la planta de personal de 4.352 a 2.831 entre 2023 y 2025, y declara la expectativa de que la cifra siga bajando. La narrativa de la recontratación, tan repetida, es una interpretación de la prensa, no del informe.

Tanto la versión triunfal como la versión humillante de esa historia fueron exageradas. Suele pasar.

Lo que sí funcionó

En todo lo que operamos y todo lo que los clientes nos mostraron, el patrón de los despliegues que sobrevivieron es consistente y poco glamoroso:

  • Un proceso, no una plataforma. Los éxitos son una cola específica con un responsable específico.
  • Mucha lectura, escritura acotada. Recuperación, redacción, enrutamiento y resúmenes, con un número pequeño de acciones de escritura protegidas.
  • Una política antes del paso con consecuencias, evaluada antes de la ejecución, no revisada después.
  • Una suite de evals construida a partir de fallas reales, y una regla de que ningún cambio de modelo sale sin pasarla.
  • Números tomados antes de empezar. Los equipos que no podían decir cuánto costaba el proceso antes siguen discutiendo si mejoró.

Nada de eso necesita un modelo de frontera. La mayor parte necesita a alguien dispuesto a hacer arqueología de procesos durante dos semanas.

Lo que sostengo de cara al próximo año

Que la restricción es la confianza y el contexto, no la capacidad. Que las empresas interesantes son dueñas de la ejecución y de la responsabilidad, no del acceso a los modelos. Que la consistencia bajo repetición es la métrica que separa la producción del teatro.

Y una nueva, aprendida este año: revisa la metodología antes de repetir la estadística, sobre todo cuando te da la razón.

Daniel Forero

Operar · Construir · Invertir · 2026