Los wrappers de Bash consumieron más tokens que el Model Context Protocol (MCP) de siete esquemas en una ejecución de 12 preguntas, demostrando que la shell no es el atajo económico que muchos ingenieros creen. El uso de tokens se traduce directamente en costes para los agentes de modelos de lenguaje extenso (LLM) que operan a escala.

El experimento que cambió las reglas del juego

Un desarrollador midió cuatro formas en las que un agente LLM podía obtener datos de embarcaciones:

  • MCP – siete esquemas de herramientas alojados tras el Model Context Protocol.
  • Bash + curl (cold) – una llamada de shell pura sin prompts adicionales.
  • Bash + curl (warm) – la misma llamada de shell más los prompts de sistema que guían un uso seguro.
  • Herramienta CLI dedicada – una interfaz de línea de comandos diseñada específicamente para este fin.

Las cuatro se sometieron a una conversación de 12 preguntas. El consumo de tokens, que determina las facturas de la API, resultó ser el siguiente:

  • MCP: 109.779 tokens
  • Bash + curl (cold): 158.021 tokens
  • Bash + curl (warm): 178.577 tokens

No se revelaron las cifras de la herramienta CLI dedicada, pero las dos variantes de Bash ya superaron el gasto de MCP.

Por qué la shell costó más que el protocolo

Cada herramienta de Bash requirió aproximadamente 2.700 tokens de “harness prompts” (prompts de soporte): las instrucciones que le dicen al agente cómo invocar la shell de forma segura, analizar la salida y gestionar errores. Solo esos prompts superan el peso total de tokens de los siete esquemas de MCP combinados.

El coste no es solo la llamada inicial. En producción, el mismo agente precargó 11 servidores MCP al inicio, consumiendo 19.800 tokens antes de que llegara la primera consulta del usuario. Luego, en cada turno, el agente volvía a leer cada esquema de cada servidor, por lo que incluso una petición trivial como “¿qué hora es?” pagaba el precio en tokens de todas las demás descripciones de herramientas.

El drenaje oculto de la carga ansiosa (eager loading)

Cuando un agente LLM realiza una carga ansiosa (eager loading) de cada servidor de herramientas en cada turno, la factura de tokens se infla drásticamente. El experimento demostró que el coste “real” de usar Bash no es el comando de la shell en sí, sino el contexto circundante que debe transmitirse al modelo cada vez.

  • Herramientas de coste fijo (esquemas MCP) añaden un sobrecoste de tokens predecible por turno.
  • Cargas dinámicas (respuestas de curl) añaden una deuda creciente que escala con la longitud de la conversación y el tamaño de los datos.

Por lo tanto, una shell que parece “gratuita” en la superficie impone en realidad un impuesto de tokens mayor y variable.

Qué deberían hacer los ingenieros de IA a continuación

  • Adoptar la carga perezosa (lazy loading). Cargar un servidor de herramientas solo cuando su esquema sea realmente necesario y mantenerlo en memoria a través de los turnos en lugar de volver a leerlo cada vez.
  • Tratar los esquemas de herramientas como un gasto fijo por turno. Planificar los presupuestos de tokens basándose en el tamaño conocido de las definiciones de MCP, en lugar de asumir que los comandos de la shell son gratuitos.
  • Reevaluar las suposiciones de “shell = barato”. Analizar el perfil de uso de tokens para cada ruta de herramienta antes de comprometerse con un diseño.
  • Mantener herramientas estructuradas en el proceso para modelos pequeños. Incluso con ventanas de contexto limitadas, los esquemas bien definidos mejoran el razonamiento, la conversión de unidades y la gestión de errores.

En conclusión: la economía de los tokens, y no el diseño del protocolo, es lo que dicta el coste. Gestionar cuándo y cómo se cargan los servidores de herramientas puede ahorrar decenas de miles de tokens en una conversación, reduciendo directamente el gasto operativo.

Fuente: https://dev.to/clarkbw--/enabling-bash-costs-more-context-than-seven-mcp-tool-schemas-2h82