Según Beating, Google está desarrollando el chip de inferencia de IA Frozen v2, que integrará parte de la arquitectura de Gemini directamente en el hardware para reducir la carga computacional y el traslado de datos durante la ejecución del modelo. Se espera que el chip procese entre 6 y 10 veces más tokens por vatio que el último TPU de Google, con despliegue previsto tan pronto como en 2028.
La iniciativa busca hacer frente a la empeorante escasez de chips de Google, que ya ha obligado a Google Cloud a rechazar pedidos de clientes externos. Frozen v2 funcionará junto con TPU; mientras que TPU admite varios modelos, Frozen v2 prioriza la eficiencia sobre la flexibilidad.