3 min de lectura

Google podría incrustar Gemini en un nuevo chip de IA

Según se informa, Google está desarrollando un chip específico para Gemini que podría ser entre 6 y 10 veces más eficiente que su silicio de IA actual.

Imagen: TNW

Según varias informaciones, Google está trabajando en un nuevo tipo de chip de IA que integraría la arquitectura de redes neuronales de Gemini directamente en el silicio, en lugar de cargar el modelo en un acelerador de propósito general. El proyecto, conocido informalmente como “Frozen v2”, fue reportado primero por The Information y luego recogido por Reuters y Bloomberg Law. Las acciones de Alphabet subieron hasta un 3,7% tras los informes.

Google no ha confirmado el proyecto, y el chip, según se informa, todavía está a varios años de distancia, con despliegue previsto para tan pronto como 2028. Aun así, la idea apunta a un enfoque más agresivo en la infraestructura de IA.

Los chips de IA actuales normalmente mantienen un modelo en memoria y mueven datos de un lado a otro mientras se ejecuta. Frozen v2, en cambio, integraría la arquitectura de Gemini directamente en el circuito. Los ingenieros aún podrían actualizar los pesos del modelo, pero la estructura central se mantendría fija —efectivamente “congelada”. Según el informe, Google todavía está decidiendo qué parte del modelo incrustar por hardware.

Recomendado

El próximo cuello de botella de la IA podría ser los materiales, no los chips

El objetivo es la eficiencia. The Information afirma que el chip podría ser entre 6 y 10 veces más eficiente que los últimos chips personalizados de IA de Google si se mide por tokens servidos por unidad de energía. Según se informa, sería una línea de silicio separada en lugar de un reemplazo de las TPUs.

Por qué Google busca un chip con modelo fijo

El momento parece estar relacionado con un cuello de botella de capacidad interna en IA. The Information informa que la presión ha sido tan intensa que Google Cloud ha tenido que rechazar a algunos clientes externos, a la vez que ha generado tensiones internas. A escala de centro de datos, un menor consumo de energía afecta directamente el coste, y un chip afinado para un único modelo puede eliminar gran parte de la sobrecarga que conlleva un diseño más flexible.

Una arquitectura fija también podría reducir la latencia, lo que la haría más adecuada para servicios en tiempo real, como asistentes de voz. Estratégicamente, lo alejaría aún más de la dependencia de Nvidia, ampliando un esfuerzo de larga duración que ya incluye las TPU internas de Google y una base de proveedores más amplia.

Google no está sola en explorar esta dirección. La startup Taalas ya presenta un concepto similar con un chip llamado Hardcore, que, según dice, imprime los pesos y la arquitectura de un modelo directamente en el hardware. Taalas afirma que su chip puede servir hasta 17.000 tokens por segundo, en comparación con aproximadamente 150 por usuario en una GPU Nvidia de máxima gama, y asegura que no requiere la costosa memoria de alto ancho de banda.

La contrapartida es obvia: menos flexibilidad. Los modelos de IA evolucionan rápidamente, y un chip construido en torno a la arquitectura actual de Gemini podría quedar obsoleto para 2028. El diseño que, según se informa, está desarrollando Google atenúa eso permitiendo actualizaciones de los pesos, pero la arquitectura en sí permanecería bloqueada.

Un portavoz de Google no confirmó el proyecto, y dijo solo que los equipos de la compañía experimentan con ideas de alta eficiencia y que no todos los esfuerzos de laboratorio llegan a producción. Por ahora, Frozen v2 parece menos un anuncio de producto que una señal de hacia dónde podría dirigirse el silicio personalizado para IA a continuación.

Marcus Vance

Enterprise Editor

Marcus follows the money. He covers enterprise software, cloud architecture, and the tectonic shifts in Big Tech strategy. He translates dense earnings calls and complex M&A activity into actionable insights about where the industry is actually heading. If a tech giant makes a silent pivot, Marcus is usually the first to notice.

vía TNW

// Sigue leyendo