Frontier · One Useful Thing

El ocaso de los chatbots

Ethan Mollick examina el rápido cambio de chatbots conversacionales a agentes que pueden realizar tareas más largas, y lo que este crecimiento exponencial de capacidad significa para expertos, gerentes e instituciones.

Este artículo ha sido traducido del texto original en inglés.

Si cree que las cosas se están acelerando en la IA, probablemente tenga razón. Se han lanzado mejores modelos de IA de los principales laboratorios estadounidenses de IA más rápidamente que nunca (aunque las intervenciones gubernamentales impidieron temporalmente el acceso a dos de los modelos más potentes, Claude Fable y GPT-5.6).

Pero no se trata sólo del momento del lanzamiento. La evidencia también apunta a una aceleración del aumento de capacidades (aunque la frontera sigue siendo irregular y las IA siguen siendo débiles en muchos lugares). Esto es especialmente obvio cuando observamos la capacidad de las IA para realizar un trabajo real. Hay algunas buenas evaluaciones que intentan medir cuánto trabajo humano pueden realizar las IA. Dos de los más famosos, de METR y el AI Security Institute oficial del gobierno del Reino Unido, estiman la cantidad de horas de esfuerzo de programador humano que la IA puede realizar con un solo mensaje. GDPval compara expertos humanos en muchos campos con el desempeño de la IA utilizando jueces profesionales. Todos están aumentando a un ritmo mejor que exponencial.

Otra organización que realiza experimentos similares, Epoch, descubrió recientemente que Opus 4.7, trabajando solo durante 14 horas, podía crear un paquete de software que requeriría de 2 a 17 semanas de trabajo de ingeniería humana (costaba 251 dólares en tokens). Una vez más, los sistemas de IA no pueden pasar todas las pruebas, ni su funcionamiento siempre es barato, pero definitivamente están mejorando a un ritmo muy rápido. En mis propios experimentos, descubrí que Fable podía trabajar de forma autónoma durante 9 horas para ejecutar proyectos de software muy complejos que a un equipo le habría llevado más de una semana realizar.

Hasta ahora, me he centrado en los modelos de frontera, aquellos con mayor “inteligencia”. Los fabrican tres empresas estadounidenses: Anthropic, OpenAI y Google (aunque ha pasado un tiempo desde que Google lanzó un nuevo modelo). Pero hay un segundo conjunto de modelos de IA cercanos a la frontera que normalmente van entre 6 y 12 meses por detrás de la frontera, todos los cuales son de China. Estos son modelos de pesos abiertos, lo que significa que cualquiera puede usarlos o modificarlos después de su lanzamiento (a diferencia de los modelos fronterizos que son propietarios). Eso hace que su funcionamiento sea bastante barato. Ellos también están subiendo una curva de mejora exponencial, aunque rezagados respecto de los modelos cerrados estadounidenses. Puede ver esto en mi gráfico del rendimiento de la IA en una prueba llamada AA-Briefcase, que simula un compromiso de consultoría complejo de varias semanas en el que la IA tiene que realizar muchos tipos de análisis. Los modelos chinos de pesos abiertos (otros países producen modelos de pesos abiertos, pero ninguno está cerca de la frontera) están en su propia curva exponencial, detrás de los modelos cerrados de EE. UU.

Pero los gráficos abstractos sólo te llevan hasta cierto punto y pueden ocultar lo irregular que es la frontera (y también el hecho de que los modelos de pesos abiertos, aunque son muy impresionantes, no siempre funcionan tan bien como indicarían sus puntos de referencia). Para obtener información real, debe intentar utilizar la IA para diferentes casos de uso y evaluar rigurosamente qué tan buenos son en las áreas que le importan. Como ejemplo divertido, creé una prueba en la que las IA tienen que crear una simulación interactiva de un puerto que evoluciona con el tiempo. Puedes jugar con todos los resultados aquí. Creo que ofrece una perspectiva interesante sobre cuánto pueden diferir los modelos entre sí en áreas como el diseño, el enfoque estilístico e incluso el criterio. A medida que los sistemas realizan tareas cada vez más largas, estos factores difíciles de comparar se vuelven más importantes.

La forma en que utilizamos la IA está cambiando

A medida que las IA pueden realizar tareas cada vez más largas, la forma en que las personas utilizan la IA está cambiando. Hasta hace poco, la forma dominante de utilizar la IA era como co-inteligencia. Le pediría a la IA que hiciera algo, verificaría los resultados y luego le pediría que hiciera el siguiente paso de su trabajo. Mediante indicaciones cuidadosas y atención humana, se podría guiar a las IA para que realicen tareas complejas y de largo plazo.

Este enfoque del uso de la IA sigue siendo común y útil, pero, cada vez más, no es la forma en que se utiliza la IA para trabajos valiosos. Los sistemas de IA de larga duración, inteligentes y autocorrectores no necesitan intervención humana constante y requieren una forma diferente de trabajar (este es también el tema de mi próximo libro, Co-Existence, que quizás quieras reservar aquí). Y, a diferencia de los chatbots, los agentes vienen con maquinaria adicional: arneses que le dan a la IA acceso a herramientas y un entorno para actuar, y aplicaciones creadas para agentes como Claude Code o el Codex de OpenAI. Como resultado, la capacidad cada vez mayor de los modelos de IA se puede mejorar aún más con un buen arnés o aplicación.

Por lo tanto, el trabajo consiste cada vez más en asignar trabajo a agentes, en lugar de trabajar junto con chatbots. Un estudio conjunto realizado por OpenAI y economistas académicos muestra con qué rapidez esto está sucediendo dentro de su propia organización. Fundamentalmente, no son sólo los codificadores los que utilizan agentes. Las funciones jurídicas, de recursos humanos y otras funciones no tecnológicas han adoptado agentes casi al mismo ritmo. OpenAI puede ser una especie de canario en la mina de carbón para lo que sucederá en otros lugares del trabajo.

Cada vez más, trabajar en OpenAI parece gestionar la IA. Una cuarta parte de los trabajadores de OpenAI tienen al menos cuatro agentes funcionando al mismo tiempo cada semana. Y, a medida que las IA realizan la codificación en arneses y aplicaciones especializados, otros roles comienzan a convertirse en una especie de codificadores. Y son buenos en eso. Un estudio de Claude Code usuarios independiente encontró que los ingenieros de software tenían una tasa de éxito similar a la de otras profesiones cuando usaban el código de Claude en tareas de codificación.

Lo que realmente importaba no era la profesión del usuario, sino su experiencia. Cuanta más experiencia en el dominio tuviera alguien, más éxito tendría al utilizar Claude Code en ese dominio. Y, lo que es aún más interesante, el resultado más útil que obtuvieron de Claude en cada mensaje.

Estamos pasando de un mundo en el que los no expertos utilizan chatbots para llenar vacíos a uno en el que los expertos utilizan agentes para realizar el trabajo. Y la mejor manera de utilizar agentes es pensar en usted mismo como un gerente.

Un momento en el tiempo

Estar en exponencial significa que cada cambio en una ventana fija es mayor que el anterior. Si su organización redactó un plan de IA en cualquier momento antes del invierno de 2025, describía un sistema que podía realizar un par de horas de trabajo con una tasa de error bastante alta. Unos meses más tarde, puede obtener dieciséis horas o más de trabajo con un solo mensaje. Es por eso que la IA sigue sintiendo que está dando saltos, aunque es una curva en un gráfico, seguimos experimentando una constante duplicación de su capacidad como una serie de shocks. Somos muy malos para sentir exponenciales desde adentro, y actualmente estamos dentro de uno.

Creo que esto también explica la turbulencia en torno a la IA mejor que las historias habituales sobre exageraciones. La IA no es capaz de ser una amenaza real a la ciberseguridad hasta que de repente lo es, lo que provoca cambios de políticas repentinos e improvisados ​​en el nivel más alto del gobierno. Los mercados descartan si la IA podría amenazar con socavar un modelo de negocio hasta que de repente puede hacerlo, lo que provoca oscilaciones masivas en las acciones. Estos bandazos se interpretan como signos de un campo inmaduro que eventualmente se convertirá en algo estable. No creo que esto vaya a solucionarse pronto. La inestabilidad es lo que sucede cuando las instituciones que se mueven a la velocidad de las personas (o peor aún, los comités) intentan seguir una curva de capacidad que no es en absoluto de naturaleza humana. Y mientras estemos en una especie de exponencial, y mientras dure, la brecha sólo se ampliará.

Los derechos pertenecen al autor y a los titulares correspondientes. Para correcciones o solicitudes de retirada, contacta con CanWin AI.