CLOSED
S&PNASDAQDOWR2KVIXAAPLMSFTNVDAGOOGLMETAAMZNTSLAAVGOGOLDWTIUSDPEN
Yahoo · 60s · delay ~15min
LIVE
BTCETHSOLXRPADABNBDOGE
CoinGecko · 30s
Cómo el diseño del sistema influye en el rendimiento de agentes de IA
Papers

Cómo el diseño del sistema influye en el rendimiento de agentes de IA

MarkTechPost (AI/ML News)23 de agosto de 2026Cortesia de MarkTechPost (AI/ML News)

Según MarkTechPost (AI/ML News), un estudio realizado en LangChain revela que el rendimiento de un agente de inteligencia artificial no depende únicamente de la selección del modelo, sino de la estructura del sistema que lo ejecuta. En una prueba llamada Terminal-Bench, reemplazar solo el "harness" —el sistema que gestiona el flujo de acciones— y mantener el mismo modelo, logró elevar el desempeño de un agente de codificación de la posición 30 a entre los primeros cinco. Este hallazgo desplaza la atención de los equipos de desarrollo hacia la arquitectura del sistema, convirtiendo la forma en que se ejecuta el ciclo del agente en una decisión técnica central, no una simple configuración de despliegue.

El curso abierto de Paul Iusztin, "Building a Coding Agent From Scratch", presenta un agente de código llamado Decode, desarrollado en Python. Este sistema se organiza en tres modos operativos, cada uno con un perfil distinto de latencia. Estos modos no solo afectan el tiempo de respuesta, sino que determinan también qué proveedor de inferencia será más adecuado. El núcleo del sistema es un "harness" sin interfaz visible, que ejecuta el ciclo básico compartido por todos los agentes: el modelo selecciona una acción, una herramienta la ejecuta y el resultado se vuelve a enviar como observación. Todo este flujo se gestiona dentro de una ventana de contexto. La definición del agente en Decode se reduce a unas 20 líneas de código usando Pydantic, que especifican el modelo, las herramientas y el tipo de salida. En comparación, el código central del ciclo en Claude Code alcanza aproximadamente 150 líneas. Cualquier funcionalidad adicional —como memoria, habilidades, entorno de prueba, permisos o retroalimentación de LSP— se encuentra en el harness, no en el núcleo.

Las interfaces se conectan directamente a este núcleo, y allí se definen los tres modos de operación. El modo 1, interactiva y en línea, utiliza una interfaz de terminal que se conecta a una sesión activa, en memoria y en el mismo proceso. Los eventos se envían en tiempo real mediante generadores asíncronos. Aquí surge un desafío técnico: si el usuario escribe mientras se ejecuta una llamada a una herramienta, el mensaje puede corromper el turno. Para resolverlo, Decode implementa una cola de dirección y un mecanismo de prioridad. Los mensajes se almacenan al llegar y solo se introducen cuando el sistema permite una transición segura. El ciclo expone dos señales clave: MODEL_REQUEST, antes de que se realice la próxima llamada al modelo, y WOULD_STOP, cuando el turno debería finalizar. Tres tipos de entrada se asignan a esta estructura: entrada directa, comando y texto, cada uno con un comportamiento específico en el flujo.

Para los usuarios peruanos, este enfoque es clave en contextos de automatización de tareas cotidianas, como la gestión de documentos, la redacción de correos o el seguimiento de procesos administrativos. Si bien los modelos de IA han sido promocionados como soluciones rápidas, este análisis demuestra que el verdadero valor está en cómo se diseña el sistema que los ejecuta. En entornos donde el tiempo y la precisión son esenciales —como en el sector público o las pequeñas y medianas empresas—, elegir un sistema adecuado, no solo un modelo, puede marcar la diferencia entre una solución funcional y una que realmente resuelve problemas de negocio.