GitHub Copilot introduce la ejecución local, pero Microsoft oculta qué datos se envían a la nube

GitHub Copilot implementará una nueva función que decide de forma automática si las tareas de codificación se ejecutan localmente o en la nube, aunque Microsoft no ha aclarado qué información se intercambia durante este proceso. La actualización llega junto con controles de sandboxing más estrictos, pero la falta de transparencia sigue generando inquietudes en equipos con políticas de datos rigurosas.

GitHub Copilot, la herramienta de asistencia para programación desarrollada por Microsoft, dará un paso significativo hacia la ejecución local de sus modelos de inteligencia artificial. A partir de finales de octubre, Copilot determinará automáticamente si las tareas de codificación se procesan en el dispositivo del usuario o si se envían a modelos en la nube. Esta decisión se tomará en función del contexto de la tarea y el estado de caché para optimizar la eficiencia y confidencialidad, según detallaron el miércoles Patrick Nikoletich, director de producto en GitHub, y Stuart Schaefer, arquitecto en Windows.

La introducción de esta funcionalidad viene acompañada por la disponibilidad general de nuevos controles de sandboxing que limitan las acciones que Copilot puede realizar en el sistema operativo local, ofreciendo un mayor nivel de protección. Sin embargo, estas protecciones varían según la herramienta: los comandos shell y los servidores MCP locales reciben restricciones a nivel del sistema operativo, mientras que las herramientas internas de archivo funcionan mediante verificaciones implementadas en el propio agente. Por su parte, los servidores MCP remotos permanecen fuera del entorno aislado local.

A pesar de la incorporación de la inferencia local, los responsables del producto reconocen que la sesión no se vuelve completamente offline. Microsoft no ha especificado cuánta información del repositorio se envía efectivamente a la nube, si los desarrolladores podrán acceder a detalles sobre esta toma de decisiones de enrutamiento ni si habrá posibilidad de limitar por completo la inferencia a modelos locales. Este vacío genera dudas especialmente entre equipos con políticas estrictas de gestión de datos, que desconocen qué fragmentos del código o metadatos pueden salir de su entorno controlado.

Patrocinado

Decisión automática sobre dónde se ejecuta la inteligencia artificial

GitHub está ampliando su proyecto HydraFusion, que hasta ahora seleccionaba qué modelos de IA utilizar para resolver determinadas tareas, para incluir también la elección del lugar de ejecución de esos modelos. Copilot evaluará tanto el contexto de la tarea como el estado de la caché para alternar entre la inferencia local y en la nube, incluso durante sesiones interactivas que requieren múltiples intercambios de información.

Los desarrolladores podrán optar por un enrutamiento automático mediante la funcionalidad Auto o elegir directamente un modelo local. Entre las opciones disponibles figuran MAI Code 1.1 Flash, que se ejecuta a través del proveedor Windows ML, y puntos de acceso compatibles con OpenAI configurados de forma local.

Transparencia pendiente en el enrutamiento automático

Sin embargo, Microsoft no ha clarificado qué cantidad de historial de conversación o contexto del repositorio se manda a la nube cuando Auto redirige una tarea. Tampoco ha mencionado si los usuarios podrán consultar las decisiones tomadas ni restringir la inferencia exclusivamente a los modelos locales. Esta incertidumbre afecta principalmente a equipos con estrictas políticas de privacidad y manejo de datos.

Seleccionar un modelo local asegura que la inferencia se realiza en el dispositivo, pero no impide que el agente acceda a servicios externos o realice solicitudes de red mediante sus herramientas integradas. Por ello, quienes requieran un entorno totalmente aislado deberán controlar también las conexiones y permisos de estas herramientas.

MAI Code 1.1 Flash: inteligencia artificial optimizada para dispositivos locales

El modelo MAI Code 1.1 Flash combina técnicas de ‘mixture-of-experts’ y cuenta con 137.000 millones de parámetros en total, de los que 6.800 millones permanecen activos durante su uso. Microsoft aplicó una cuantización con precisión mixta, reduciendo los parámetros a aproximadamente 3,3 bits cada uno y comprimiendo el modelo hasta los 53 GB, un 80 % menos que la versión en la nube con bfloat16.

Este esfuerzo forma parte de una tendencia general para adaptar potentes modelos de IA a hardware más limitado, similar a la compresión extrema que realiza Intel en su propio modelo de lenguaje. Además, Microsoft ha combinado la cuantización con técnicas de decodificación especulativa, en la que se generan propuestas previas que el modelo principal verifica, acelerando la respuesta durante la ejecución local.

Desafíos de memoria y requisitos de hardware

La introducción de estos modelos está pensada inicialmente para equipos potentes como los portátiles Surface Laptop Ultra equipados con tarjetas gráficas NVIDIA RTX Spark y hasta 128 GB de memoria unificada. En estas máquinas, el pico de consumo puede alcanzar los 75,5 GB de RAM al manejar contextos de hasta 256.000 tokens. Este nivel de demanda descarta a la mayoría de ordenadores portátiles tradicionales, que normalmente disponen de 16 o 32 GB de memoria.

Es importante destacar que el tamaño de los pesos del modelo —53 GB— no refleja el total de recursos requeridos. El sistema operativo, las aplicaciones, el entorno de ejecución de la inferencia y la caché de valores clave también consumen memoria, y esta caché aumenta con el tiempo a medida que Copilot procesa archivos y resultados de herramientas. Por tanto, los desarrolladores deben tener en cuenta un margen de memoria considerable para sesiones prolongadas.

Resultados de rendimiento y calidad

En las pruebas que Microsoft ha divulgado, el modelo cuantizado obtuvo un 70,8 % en SWE-Bench Verified, solo ligeramente por debajo del 72,6 % del modelo en precisión completa. Además, superó a su predecesor en Terminal-Bench 2.1, logrando un 66,29 % frente al 62,9 % sobre un conjunto de 89 tareas. Aunque estas diferencias son pequeñas, indican que la compresión casi no sacrifica la calidad del desempeño en entornos reales de programación.

Sandboxing y seguridad

Copilot utiliza la biblioteca de contenedores de ejecución de código abierto de Microsoft, Execution Containers (MXC), para implementar políticas de sandboxing. En Windows, se recurre a la capa BaseContainer del backend ProcessContainer; en macOS, a Seatbelt; y en Linux, a bubblewrap. Estas capas limitan los comandos shell y los servidores MCP locales bajo restricciones activas del sistema operativo.

En cambio, las herramientas integradas de gestión de archivos operan dentro del proceso del agente, realizando comprobaciones de conformidad directamente contra las políticas del sandbox sin depender exclusivamente del aislamiento del sistema operativo. Los servidores MCP remotos están fuera del sandbox local y sus conexiones se controlan mediante políticas específicas cuando el sandboxing MCP está habilitado.

Reclamos de funcionamiento offline cuestionados

Microsoft mostró un ejemplo demostrativo empleando MAI Code 1.1 Flash para crear un panel de triage diario dentro de un proyecto sandbox llamado copilot-sdk, que describió como un flujo de trabajo offline. Sin embargo, este ejemplo empleaba metadatos de incidencias y solicitudes de extracción de GitHub, en lugar de utilizar directamente repositorios y pruebas locales como se mencionó anteriormente. No se ha aclarado si esos metadatos se obtuvieron mediante conexión a red o de cachés locales, dejando sin verificar la afirmación de trabajo completamente offline.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado