Registro Nornic · Documento vivo
“Los agentes de IA ya pueden trabajar de forma autónoma durante días.”
El instrumento público más citado para la duración de tareas de agentes dice que deja de ser fiable a las dieciséis horas. Más allá de ahí, no hay nada contra lo que contrastar la afirmación.
La fuente
- Estudio
- Task-Completion Time Horizons of Frontier AI Models
- Editor
- METR
- Tipo de publicación
- Medición pública continua, interactiva
- Muestra
- Modelos de frontera frente al conjunto de tareas de METR; líneas base humanas de profesionales contratados
- Trabajo de campo
- Actualizado el 8 de mayo de 2026
- Financiación y conflictos
- METR — organización sin ánimo de lucro de evaluación de IA
- Verificado el
- 2026-08-09
La aritmética
METR mide la capacidad como un horizonte temporal del 50%: en sus palabras, «la duración de una tarea de nuestro conjunto (medida por lo que tarda un experto humano) tal que predeciríamos con un 50% de confianza que el modelo podría completarla».
El techo está indicado en la propia página, sin que nadie lo pregunte: «Las mediciones por encima de 16 h no son fiables con nuestro conjunto de tareas actual».
Dieciséis horas son dos jornadas laborales de una persona. Así que el instrumento cubre aproximadamente el rango que ocupa una demo de proveedor — y se detiene justo donde empieza el marketing más ambicioso.
Esto no es afirmar que los agentes de larga duración fracasen. Es algo más estrecho e incómodo: por encima de aproximadamente una jornada laboral, no existe una medición pública aceptada que lo indique en un sentido ni en otro. La ausencia de un instrumento no es prueba de ausencia.
Las afirmaciones en horas de un solo dígito están dentro del rango medible y aquí no se discuten. El veredicto se aplica a «días», no a «horas».
Conviene conocer las líneas base al leer cualquier cifra de horizonte: las personas contratadas por METR son profesionales de ingeniería de software, ML o seguridad, con unos cinco años de experiencia relevante de media, y la duración de las tareas procede de la media geométrica de sus tiempos de finalización con éxito. La comparación es contra profesionales competentes, no contra novatos.
Nornic no hace ninguna afirmación sobre cuánto tiempo puede funcionar un agente sin supervisión, porque no hay nada en lo que basarla. Esa es la entrada.
Qué cambiaría este veredicto
Un conjunto de tareas publicado con mediciones fiables más allá de las dieciséis horas, y una cifra de horizonte medida sobre él. Que METR ampliara su propio conjunto bastaría; también lo haría un instrumento independiente con un método inspeccionable.
Fuentes
