Google se asocia con PyTorch de Meta para desafiar el dominio de la IA de Nvidia

Actualización definitiva: 12/17/2025
  • Google está desarrollando "TorchTPU" para que sus chips de IA sean totalmente compatibles con PyTorch y facilitar la migración desde las GPU Nvidia.
  • La medida tiene como objetivo convertir las TPU en una alternativa convencional en la nube y en las instalaciones locales, reduciendo la dependencia del ecosistema CUDA de Nvidia.
  • Google está colaborando estrechamente con Meta, administrador de PyTorch, y está considerando publicar en código abierto partes de la pila para acelerar su adopción.
  • Un mayor soporte de PyTorch podría reducir costos y barreras técnicas para las empresas que desean diversificar su infraestructura de IA.

Ecosistema de hardware y software de IA

Google está reformulando discretamente su estrategia en la carrera por la computación de inteligencia artificial . Tras años de centrarse en sus propios marcos internos, la compañía ahora está haciendo un esfuerzo real por lograr que sus chips de IA funcionen a la perfección con PyTorch, el conjunto de herramientas de código abierto que se ha convertido en la opción predeterminada para la mayoría de los desarrolladores de IA en todo el mundo.

En el centro de este cambio se encuentra un proyecto conocido internamente como "TorchTPU" , una iniciativa diseñada para reducir la brecha entre cómo se construye el hardware de Google y cómo los clientes construyen sus sistemas de IA. Al elevar la compatibilidad con PyTorch a un nivel de primera clase en sus Unidades de Procesamiento Tensorial (TPU), Google busca reducir la enorme ventaja que Nvidia ha construido a través de su ecosistema de software CUDA.

Google convierte las TPU en un serio rival para las GPU de Nvidia

Las TPU de Google se han promocionado durante mucho tiempo como chips de alto rendimiento diseñados para cargas de trabajo de IA , pero no han alcanzado la omnipresencia de las GPU de Nvidia. Una razón clave es que Nvidia dedicó años a garantizar que PyTorch funcionara excepcionalmente bien en su hardware, mientras que Google se centró principalmente en sus propias herramientas y flujos de trabajo internos.

Dentro de Alphabet, las TPU se han convertido en un motor de crecimiento fundamental para Google Cloud . Vender el acceso a estos chips a través de su plataforma en la nube es ahora una parte esencial de cómo Google pretende demostrar a los inversores que sus inversiones en IA pueden traducirse en ingresos tangibles, y no solo en prestigio en investigación o productos experimentales.

Sin embargo, el hardware por sí solo no convence a los desarrolladores. Las empresas que consideran las TPU le han dicho repetidamente a Google que la compatibilidad del software ha sido un obstáculo : los equipos que han estandarizado en gran medida PyTorch no quieren rediseñar su código ni capacitar nuevamente a su personal solo para probar un nuevo chip.

Ahí es donde entra en juego TorchTPU. Esta iniciativa busca que, desde la perspectiva del desarrollador, las TPU sean tan fáciles de usar con PyTorch como lo son hoy en día las GPU de Nvidia . El objetivo es que los modelos y flujos de trabajo de PyTorch existentes se puedan migrar con cambios mínimos, reduciendo drásticamente el costo y el riesgo de experimentar con las TPU.

Un portavoz de Google Cloud evitó entrar en detalles técnicos, pero confirmó que el objetivo principal es brindar a los clientes mucha más flexibilidad en la forma en que ejecutan cargas de trabajo de IA , independientemente del hardware que elijan.

Lo que TorchTPU realmente cambia para los desarrolladores de PyTorch

PyTorch, creado y promovido originalmente por Meta, se ha convertido en el marco de trabajo estándar de facto para la creación de sistemas de IA modernos . La mayoría de los ingenieros en Silicon Valley y otros lugares no programan manualmente los kernels para los chips de Nvidia, AMD o Google; en cambio, confían en PyTorch y marcos de trabajo similares que proporcionan capas de componentes preconstruidos y utilidades de entrenamiento.

Desde su lanzamiento en 2016, el crecimiento de PyTorch ha estado estrechamente ligado a CUDA y sus bibliotecas asociadas , el conjunto de software que muchos analistas de Wall Street consideran el activo estratégico más importante de Nvidia. Los ingenieros de Nvidia han invertido considerablemente para garantizar que PyTorch funcione con la máxima eficiencia en sus GPU, lo que convierte a esta combinación en la opción predeterminada para entrenar e implementar modelos de IA a gran escala.

Google, por el contrario, dedicó años a respaldar Jax , otro marco de software preferido especialmente dentro de sus propios equipos de investigación y desarrollo de productos. Las TPU dependían de una capa de compilación llamada XLA para ejecutar código basado en Jax de manera eficiente, y gran parte de la pila de software de IA interna de Google y las optimizaciones de rendimiento se construyeron en torno a esa combinación.

El resultado es una creciente discrepancia entre cómo Google utiliza sus chips y cómo prefieren trabajar la mayoría de sus clientes externos. Muchas empresas han estandarizado casi por completo el uso de PyTorch, lo que significa que la migración a TPU generalmente implicaba un cambio radical en las herramientas, el código y las habilidades de los desarrolladores.

Con TorchTPU, Google busca eliminar esa fricción. El proyecto pretende ofrecer compatibilidad total con PyTorch en TPUs , de modo que las empresas puedan seguir utilizando bibliotecas, bucles de entrenamiento y patrones de implementación conocidos, cambiando únicamente el hardware subyacente. Esto podría reducir drásticamente tanto el esfuerzo de ingeniería como la curva de aprendizaje para los equipos que deseen evaluar el rendimiento o las ventajas de coste de las TPUs.

Más recursos, código abierto y un compromiso más profundo

Según fuentes cercanas a la iniciativa, TorchTPU no es un simple experimento secundario. A diferencia de algunos intentos anteriores de ejecutar PyTorch en TPUs, Google le ha asignado ahora mayor atención organizativa, presupuesto e importancia estratégica , tratándolo como un pilar fundamental de su hoja de ruta de infraestructura de IA, en lugar de un proyecto de compatibilidad marginal.

Uno de los aspectos más destacados que se están considerando es la liberación del código fuente de partes del software que sustenta TorchTPU. Al compartir componentes clave con la comunidad, Google espera acelerar su adopción, atraer colaboradores externos y generar confianza entre los grandes clientes que buscan transparencia y estabilidad a largo plazo en sus plataformas de IA.

Esta actitud más abierta también busca tranquilizar a las empresas que consideraban que la compatibilidad con TPU estaba demasiado ligada a la forma interna de trabajar de Google. Brindar a los desarrolladores externos la oportunidad de inspeccionar, extender y depurar los componentes de TorchTPU podría hacer que las TPU se perciban menos como un ecosistema propietario aislado y más como un componente fundamental dentro del ecosistema PyTorch.

Para las empresas, esto tiene implicaciones prácticas. Si TorchTPU tiene éxito, podría reducir significativamente el coste de migración de las GPU de Nvidia a las TPU de Google , lo que facilitaría la diversificación de la infraestructura informática sin tener que embarcarse en una reescritura de software que dure varios años.

Los clientes le han dicho repetidamente a Google que el requisito histórico de cambiar a Jax era un gran obstáculo. PyTorch ya domina entre los desarrolladores de IA, y en mercados que evolucionan rápidamente, pocas organizaciones están dispuestas a pausar sus planes de desarrollo de productos mientras sus equipos se adaptan a un nuevo marco de trabajo solo para acceder a hardware alternativo.

Desde hardware interno hasta una amplia oferta empresarial

Durante mucho tiempo, Alphabet reservó la mayor parte de su capacidad de TPU para uso interno dentro de Google , impulsando la búsqueda, la traducción, los sistemas de recomendación y la investigación inicial en IA. Esta postura comenzó a cambiar en 2022, cuando la división de computación en la nube obtuvo mayor autoridad sobre cómo se comercializaban y vendían las TPU.

Desde entonces, la disponibilidad de TPU a través de Google Cloud ha aumentado sustancialmente . A medida que el interés empresarial en la IA se ha acelerado, Google ha posicionado sus chips como una forma para que los clientes accedan a computación de alto rendimiento sin tener que administrar sus propios clústeres de GPU estrechamente acoplados.

Más recientemente, Google ha dado un paso más allá al vender TPUs directamente para su implementación en los centros de datos de los clientes , y no solo a través de su nube pública. Este cambio permite a las organizaciones más grandes con estrictos requisitos normativos o de latencia integrar las TPUs en su infraestructura local, sin dejar de beneficiarse de la hoja de ruta de hardware de Google.

Esta expansión también redefine las prioridades internas de Google. La compañía necesita capacidad de TPU tanto para ejecutar sus propios productos de IA —desde el chatbot Gemini hasta las funciones de búsqueda impulsadas por IA— como para atender a clientes externos de Google Cloud, incluidas empresas de IA de alto perfil como Anthropic que dependen de la capacidad de TPU alquilada.

Para coordinar todo esto, Google ha elevado el liderazgo en infraestructura de IA: el veterano ejecutivo Amin Vahdat fue nombrado director de infraestructura de IA y ahora reporta directamente al CEO Sundar Pichai . Esta línea jerárquica subraya la importancia que ha adquirido el hardware y el software para las ambiciones de Google en el ámbito de la IA.

Asociación con Meta para fortalecer PyTorch en TPU

Google no está trabajando sola en TorchTPU. Según fuentes cercanas a las conversaciones, la compañía está colaborando estrechamente con Meta, creador y responsable de PyTorch , para acelerar la compatibilidad con TPU y alinear las directrices técnicas que beneficien a ambas partes.

Las conversaciones entre las empresas incluyen acuerdos que darían a Meta acceso a una mayor capacidad de TPU . Según se informa, propuestas anteriores lo planteaban como servicios gestionados: Google desplegaría sus chips en entornos donde Meta podría ejecutar su propio software y modelos, y Google se encargaría de gran parte de la gestión operativa.

Para Meta, lograr que PyTorch funcione de manera eficiente en una gama más amplia de hardware es estratégicamente importante. La empresa tiene un claro incentivo para reducir los costos de inferencia y diversificar su economía, alejándose de la dependencia exclusiva de las GPU de Nvidia , tanto para disminuir sus propios gastos como para fortalecer su posición negociadora al adquirir chips en el futuro.

Al colaborar con Google, Meta puede contribuir a que PyTorch siga siendo independiente del hardware y ampliamente optimizado , en lugar de estar estrechamente vinculado al ecosistema de un único proveedor. Esto, a su vez, refuerza la posición de PyTorch como estándar de la comunidad y mantiene el framework atractivo tanto para investigadores como para empresas.

Hasta el momento, Meta se ha negado a comentar públicamente sobre estos acuerdos específicos, pero la convergencia de intereses es clara : el gigante de las redes sociales y la IA quiere opciones más allá de Nvidia, mientras que Google quiere que PyTorch se integre de forma nativa en sus TPU para que más clientes estén dispuestos a probarlo.

Reducir la ventaja de CUDA de Nvidia

El dominio de Nvidia en IA no se limita al desarrollo de potentes GPU. A lo largo de muchos años, la compañía ha desarrollado una extensa pila de software, basada en..., que está profundamente integrada en frameworks como PyTorch. Esta combinación de hardware y software se ha convertido en la plataforma de entrenamiento e inferencia por excelencia para modelos de IA de vanguardia.

Debido a esa estrecha integración, muchas organizaciones consideran que alejarse de Nvidia es arriesgado y costoso . Los códigos fuente, los flujos de trabajo y la experiencia del personal están optimizados para CUDA, lo que hace que los chips alternativos parezcan una posible fuente de problemas, incluso si prometen mejores precios o rendimiento sobre el papel.

El proyecto TorchTPU de Google busca directamente contrarrestar esa ventaja. Si PyTorch puede ejecutarse en TPUs con la misma facilidad y optimización de rendimiento que en las GPU de Nvidia, las empresas contarán con una alternativa viable para grandes cargas de trabajo de IA . En un mercado donde la demanda de computación para IA está creciendo exponencialmente y la oferta es escasa, disponer de otra opción sólida podría resultar muy atractivo.

Al mismo tiempo, la decisión de Google de considerar la posibilidad de liberar como código abierto componentes clave de la pila TorchTPU indica un enfoque diferente al estilo más verticalmente integrado de Nvidia. Al compartir una mayor parte del software subyacente, Google busca generar confianza entre los desarrolladores que valoran la transparencia y la portabilidad.

Nada de esto garantiza que las TPU reemplacen a las GPU, pero sí cambia el panorama. En lugar de elegir entre el ecosistema consolidado de Nvidia y una alternativa que requiere una migración completa de herramientas, los clientes podrían sopesar el rendimiento, el coste y la disponibilidad sin salir del entorno familiar de PyTorch.

Tanto en las implementaciones en la nube como en las locales, este cambio podría facilitar a las organizaciones la combinación de diferentes proveedores de hardware a lo largo del tiempo, en lugar de limitar sus planes de IA a un único proveedor por defecto.

A medida que Google profundiza su compromiso con PyTorch a través de TorchTPU, aumenta el acceso empresarial a las TPU y estrecha la colaboración con Meta, el panorama competitivo en torno a la infraestructura de IA se vuelve más dinámico. El liderazgo de Nvidia, basado en años de integración de hardware y CUDA, sigue siendo considerable, pero los clientes ahora ven vías más realistas para diversificar dónde se ejecutan sus cargas de trabajo de IA y cuánto pagan por la computación subyacente.

Interruptor de muerte
Artículo relacionado:
Nvidia rechaza las acusaciones de "interruptor de seguridad" y las propuestas de políticas para chips de IA
Artículos Relacionados: