• 4 min de lectura
Herramientas de codificación con IA divididas por entornos ricos en contexto
Augment Code sostiene que la recuperación semántica preindexada ayuda a repositorios privados grandes, mientras que Anthropic respalda un entorno más ligero para Claude Code.

Imagen: Ars Technica
El último debate en el desarrollo de software asistido por IA ya no se centra solo en qué modelo es el mejor. Cada vez trata más sobre el entorno que rodea al modelo: la capa de software que decide lo que el modelo ve, qué herramientas puede usar y cómo interactúa con una base de código.
Ese debate se está librando ahora entre Claude Code de Anthropic y Augment Code. Anthropic ha defendido un entorno ligero, con menos supuestos incorporados y una recolección de contexto menos estructurada por defecto. Vinay Perneti, vicepresidente de ingeniería de Augment Code, dijo a Ars Technica que su empresa apuesta por lo contrario: que una infraestructura de contexto más rica mejora sustancialmente el rendimiento en la codificación, sobre todo en repositorios privados grandes.
Según Perneti, Augment preindexa repositorios usando embeddings, un modelo de recuperación y una base de datos vectorial, para luego mostrar código conceptualmente relevante en tiempos inferiores al milisegundo. Contrastó eso con enfoques más basados en grep utilizados por Claude Code, Codex y otros agentes.
Perneti dijo que la diferencia importa sobre todo fuera de los benchmarks públicos. En repositorios de código abierto, sostuvo, los modelos líderes a menudo ya han visto de facto suficiente del código para rendir bien. Las bases de código privadas son distintas porque el modelo nunca las ha encontrado antes, lo que hace que la recuperación y la recopilación de contexto sean más importantes.

Recomendado
Jaron Lanier dice que 'IA' es la historia equivocada
También vinculó el enfoque al uso de tokens. Perneti señaló un artículo del blog de Augment que afirma que, en Terminal-Bench usando el mismo modelo que Claude Code, Augment alcanzó una precisión similar siendo un 33 por ciento más eficiente. Sugirió que algunos desacuerdos con Anthropic pueden deberse a qué es exactamente lo que se está evaluando, observando que no todos los sistemas de recuperación son equivalentes y que Augment pasó unos 18 meses después de la fundación de la empresa en 2022—antes de ChatGPT—investigando modelos de recuperación y de embeddings para grandes repositorios de código.
Contexto, costo y confianza
Perneti planteó el problema como un equilibrio entre inteligencia y contexto. Los modelos seguirán mejorando, dijo, pero eso no significa que automáticamente tengan el contexto correcto del proyecto. Para los líderes de ingeniería, eso convierte el diseño del entorno en una cuestión de costo: cuánto del presupuesto de tokens se gasta en recopilar contexto frente a producir resultados útiles.
También fue franco respecto a los límites actuales. Los agentes, dijo, no son buenos escribiendo especificaciones, y el juicio humano sigue importando en áreas como la revisión y la verificación. Añadió que la deuda técnica es un problema real, describiendo un patrón dentro de Augment en el que los agentes son buenos duplicando código. La compañía ha respondido con sprints de limpieza focalizados utilizando a los propios agentes, guiados por especificaciones explícitas para reducir la deuda.
Sobre el costo, Perneti dijo que los equipos podrían eventualmente dividir las cargas de trabajo entre modelos de vanguardia para las tareas más difíciles y modelos open source o más pequeños para trabajo de codificación bien especificado. Si ese cambio ocurre, sostuvo, los costos de tokens podrían caer significativamente.
Ars señala que Anthropic y Augment no están necesariamente midiendo las mismas cosas. Cat Wu, jefa de producto de Anthropic para Claude Code, había dicho previamente que Anthropic no vio “una mejora medible en el rendimiento” al añadir algunas herramientas de navegación de código como los LSP. Eso no es lo mismo que evaluar un motor de contexto más amplio como el de Augment, lo que puede ayudar a explicar las conclusiones divergentes.
En lo que parecen coincidir ambas partes es en la dirección general: el desarrollo de software está cambiando rápidamente, se avecinan flujos de trabajo más autónomos, y mejores modelos no eliminarán la necesidad del juicio de ingeniería. Si acaso, un ritmo de entrega más rápido puede hacer que las malas decisiones sean más costosas.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía Ars Technica


