La reciente integración de los modos chat y Cowork en una única interfaz por parte de Anthropic ha simplificado la experiencia de usuario al eliminar la necesidad de elegir entre diferentes modos para distintas tareas. Ahora, basta con plantear una consulta y delegar tareas en el mismo hilo, dejando que Claude decida cómo gestionar cada petición. Actualmente, esta función está disponible para los clientes de los planes Pro y Max, con planes de extenderse a otros niveles en el futuro.
Por su parte, OpenAI presentó el modo Work con ChatGPT a inicios de julio, quitando poco después el modo Agent independiente. Este entorno ofrece funcionalidades como navegador integrado, ejecución de código y generación de archivos, todo accesible en una sola ventana, aunque sin la capacidad de pasar una sesión de navegador activa e identificada al usuario para interactuar en tiempo real. La evolución se basa en Codex, dado que circa el 20% de sus cinco millones de usuarios semanales no son desarrolladores, un segmento que crece al triple de velocidad que el de programadores.
Dado que ambas plataformas buscan equipararse en funcionalidades, la precisión, fiabilidad y eficiencia en el consumo de tokens son factores clave. Por ello, se llevaron a cabo tres pruebas específicas enfocadas en áreas relevantes para desarrolladores.
Las pruebas realizadas
- Investigación de APIs: Consistió en localizar y tabular limitaciones de uso, existencia de planes gratuitos y versiones actuales de cuatro APIs reales: GitHub REST API, Stripe API, Twilio Messaging API y OpenAI API. Se verificaron las respuestas contra la documentación oficial el mismo día.
- Desarrollo a partir de una especificación: Se pidió crear una herramienta de línea de comandos para interpretar duraciones con reglas estrictas, evaluando el código generado con una batería oculta de 16 pruebas.
- Delegación de tareas: Primero, identificar cuál de dos trazas de pila evidenciaba una condición de carrera y en qué consistía. Seguidamente, analizar un archivo de registro alojado en Google Drive para calcular percentiles de latencia, tasas de error y generar una hoja de cálculo con gráficos representativos, mostrando también los datos en la respuesta.
Se midió el tiempo consumido y el uso de tokens en cada prueba, ofreciendo además los prompts para posibles replicaciones.
Investigación de APIs
Ambas plataformas acertaron en los campos evaluados. No obstante, Claude fue más exhaustivo, proporcionando información adicional como los límites específicos para tokens Actions en GitHub, detalles de la ventana de cola en Twilio y umbrales de niveles en OpenAI, además de señalar una página inaccesible.
ChatGPT completó la tarea en 1 minuto y 17 segundos generando 649 tokens de salida, mientras que Claude tomó 1 minuto y 44 segundos con 1.042 tokens, consultando ocho páginas e incluyendo nueve fuentes, incluso ofreciendo exportar la tabla en formato de hoja de cálculo. La mayor extensión de Claude se justificó por el nivel de detalle añadido.
Desarrollo desde especificación
Ambos programas entregaron un archivo llamado durparse.py que superó las 16 pruebas ocultas, incluyendo casos límite como unidades en orden incorrecto, repeticiones, números sin unidad y valores negativos. El prompt, de 517 tokens, fue procesado por ambas herramientas: ChatGPT tardó 1 minuto y 17 segundos generando 769 tokens; Claude empleó 1 minuto y 45 segundos con 989 tokens.
Claude detalló haber ejecutado 35 casos de prueba propios antes de entregar el código y comentó una decisión interpretativa sobre redondeo que el enunciado no especificaba, mientras ChatGPT simplemente informó del éxito en las pruebas. Ambos mostraron el código completo y ofrecieron descarga directa.
Delegación de tareas
En la pregunta sobre cuál de dos trazas indicaba una condición de carrera, ambos acertaron rápidamente: la traza B, vinculada a un diccionario alterado durante la iteración. ChatGPT emitió su respuesta en unos 10 segundos con 48 tokens; Claude tardó 25 segundos generando 118 tokens, aportando además una aclaración sobre la aparición de errores similares sin concurrencia.
Sin cambiar de contexto, se pasó a analizar un archivo CSV con registros desde Google Drive. Claude completó el procesamiento, generó tabla y elaboró una hoja de cálculo con un gráfico de barras en aproximadamente cuatro minutos, produciendo 319 tokens de salida. ChatGPT logró lo mismo en 28 segundos con 467 tokens. Ambos brindaron datos exactos respecto a la información de base, aunque Claude identificó el método estadístico empleado y destacó que los resultados coincidirían si se recalcularan en Google Sheets. ChatGPT presentó la tabla correcta pero con menos detalles.
Conclusiones de la prueba
| Prueba | ChatGPT (modo Work) | Claude (app unificada) |
|---|---|---|
| Investigación de APIs | 12/12 campos correctos, 1:17 min, 125 in / 649 out tokens | 12/12, 1:44 min, 125 in / 1.042 out tokens |
| Desarrollo desde especificación | 16/16 pruebas, 1:17 min, 517 in / 769 out tokens | 16/16 pruebas, 1:45 min, 517 in / 989 out tokens |
| Pregunta delegada | Correcto, ~10 s, 135 in / 48 out tokens | Correcto, ~25 s, 135 in / 118 out tokens |
| Tarea delegada | 30/30 datos correctos, 28 s activo, 133 in / 467 out tokens | 30/30, ~4 min, 133 in / 319 out tokens |
| Total tokens visibles | 910 in / 1.933 out | 910 in / 2.468 out |
Tanto Claude como ChatGPT demostraron igual nivel de exactitud en todas las áreas evaluadas, reflejando información verificada y consistente con la documentación oficial.
Las diferencias radican principalmente en la rapidez y el nivel de detalle aportado. ChatGPT fue más veloz en todas las pruebas y generó un 22% menos tokens, lo que puede interpretarse como mayor eficiencia. No obstante, Claude compensó con respuestas más enriquecidas, entregando contexto adicional, explicaciones técnicas y destacando decisiones no especificadas en las instrucciones, aspectos fundamentales ante la creciente preocupación por la veracidad y profundidad en la inteligencia artificial.
Reflexión final
A pesar de la rapidez de ChatGPT y su menor consumo de tokens, la riqueza informativa y el cuidado en los detalles que ofrece Claude resultan decisivos para quienes valoran un trabajo minucioso y bien fundamentado. Así, en escenarios profesionales donde la precisión y la contextualización son claves, Claude puede considerarse una herramienta más completa.