La compañía con sede en Pekín, conocida en China como Zhipu AI, lanzó oficialmente GLM-5.3-Flash el 26 de agosto después de haberlo probado discretamente bajo el nombre en clave Ox Alpha. El modelo anónimo apareció previamente en OpenRouter y OpenCode, donde atrajo rápidamente un volumen considerable de uso por parte de desarrolladores antes de que Z.AI revelara su identidad.

Según la empresa, el tráfico generado durante esa fase de prueba fue gestionado por un clúster compuesto por aproximadamente 100.000 chips de IA fabricados en China. Z.AI no ha identificado públicamente a los proveedores concretos del hardware y esta afirmación todavía no ha sido verificada de forma independiente.

En una publicación oficial, Z.AI explicó que GLM-5.3-Flash fue desplegado a gran escala sobre aceleradores chinos utilizando una infraestructura de inferencia optimizada específicamente para las limitaciones del hardware nacional. La compañía afirma que estos cambios permitieron aproximadamente triplicar el rendimiento de servicio frente a su configuración inicial.

Ox Alpha era en realidad GLM-5.3-Flash

Antes de su lanzamiento público, GLM-5.3-Flash pasó varios días disponible como el misterioso modelo Ox Alpha. Esta estrategia permitió a Z.AI someter el sistema a cargas de trabajo reales de desarrolladores sin revelar inicialmente qué empresa estaba detrás del modelo.

La compañía sostiene que Ox Alpha procesó alrededor de 62 billones de tokens en OpenRouter y OpenCode antes de que se hiciera pública su identidad. Los datos de OpenRouter también mostraron un uso especialmente elevado durante los primeros días, sobre todo en tareas relacionadas con programación.

El enfoque no es completamente nuevo entre los desarrolladores chinos de IA. Algunas compañías han comenzado a probar modelos de forma anónima antes de vincularlos a una marca concreta, lo que permite observar su rendimiento en condiciones reales sin el efecto de las expectativas asociadas a un lanzamiento importante.

GLM-5.3-Flash llega después de GLM-5 de Zhipu AI, presentado anteriormente como un modelo de pesos abiertos de gran escala orientado especialmente a programación y tareas prolongadas de agentes de IA.

320.000 millones de parámetros, pero solo 18.000 millones activos

GLM-5.3-Flash cuenta con 320.000 millones de parámetros totales, aunque activa alrededor de 18.000 millones en cada solicitud. Su arquitectura Mixture-of-Experts está diseñada para reducir la cantidad de cálculo necesaria durante la inferencia sin renunciar a las capacidades de un modelo considerablemente más grande.

También es el primer modelo multimodal nativo de la familia GLM-5, lo que le permite trabajar de forma conjunta con texto, imágenes y vídeo. Z.AI lo posiciona para programación, flujos de trabajo con agentes, comprensión visual y otras tareas de contexto amplio.

La empresa afirma haber rediseñado tanto la arquitectura como el software de servicio para mejorar la eficiencia. Entre otras técnicas, el sistema separa distintas fases de inferencia en grupos de cálculo administrados de forma independiente y aplica optimizaciones de cuantización y memoria para reducir la presión sobre el ancho de banda del hardware.

Este punto es especialmente relevante porque los aceleradores chinos de IA siguen enfrentándose, en términos generales, a limitaciones de ancho de banda de memoria y potencia de cálculo frente a los procesadores más avanzados de Nvidia. El acceso restringido a chips de gama alta continúa siendo uno de los principales obstáculos para la industria china de inteligencia artificial.

China pone a prueba sus chips nacionales a gran escala

La importancia de GLM-5.3-Flash va más allá del propio modelo. Si las afirmaciones de Z.AI se confirman, el despliegue demostraría que aceleradores diseñados en China pueden gestionar cargas de inferencia de gran escala para un modelo competitivo sin depender directamente de GPU de Nvidia.

Z.AI no ha revelado qué chips concretos forman parte del clúster de 100.000 unidades. La empresa ha colaborado anteriormente con fabricantes nacionales de semiconductores como Huawei, Cambricon Technologies y Moore Threads. Tanto Cambricon como Moore Threads han anunciado compatibilidad con el nuevo modelo GLM.

Sin embargo, es importante distinguir entre inferencia y entrenamiento. Servir un modelo ya entrenado suele requerir menos recursos que entrenar desde cero un sistema de escala frontier. Por ello, este despliegue no demuestra que los chips chinos hayan alcanzado la paridad con Nvidia en todas las etapas del desarrollo de inteligencia artificial.

Las afirmaciones de Z.AI sobre eficiencia de hardware y costes tampoco han sido verificadas todavía de forma independiente. Aun así, la escala del despliegue convierte a GLM-5.3-Flash en uno de los ejemplos más relevantes del esfuerzo de China por reducir su dependencia de infraestructura extranjera.

Un precio agresivo para atraer desarrolladores

Z.AI también está compitiendo con fuerza en precio. GLM-5.3-Flash se ofrece a un coste muy inferior al modelo GLM-5.3 completo, con tarifas estándar de aproximadamente 0,15 dólares por millón de tokens de entrada y 0,50 dólares por millón de tokens de salida.

La combinación de pesos abiertos, menores requisitos de inferencia y precios agresivos de API podría hacer que el modelo resulte atractivo para desarrolladores que buscan alternativas a sistemas frontier más costosos de proveedores estadounidenses.

Las primeras opiniones han sido mixtas. Algunos desarrolladores han destacado la capacidad de Ox Alpha para resolver tareas complejas de programación y depuración, mientras que Patrick Collison, CEO de Stripe, describió públicamente su experiencia con el modelo como muy impresionante. Otros usuarios, sin embargo, han informado de alucinaciones, tareas incompletas y una generación de código más lenta de lo esperado.

Esto deja abierta la cuestión de su posición competitiva a largo plazo, pero el lanzamiento muestra una tendencia cada vez más clara: las empresas chinas de IA ya no compiten únicamente en benchmarks. También están apostando por precios bajos, distribución abierta y la capacidad de ejecutar grandes cargas de trabajo sobre infraestructura nacional.

Las acciones de Z.AI suben tras la revelación

Los inversores reaccionaron positivamente al anuncio. Las acciones de Z.AI subieron más de un 12% en Hong Kong el 27 de agosto después de que la compañía confirmara que Ox Alpha era GLM-5.3-Flash y que el modelo había sido servido utilizando chips fabricados en China.

Z.AI fue fundada en Pekín en 2019 a partir de investigaciones vinculadas a la Universidad de Tsinghua y se ha convertido desde entonces en uno de los desarrolladores de grandes modelos de lenguaje más destacados de China. Su familia GLM compite con sistemas de Alibaba, Moonshot AI, DeepSeek y otros laboratorios chinos.

Para China, la cuestión principal es si proyectos como GLM-5.3-Flash pueden transformar el hardware nacional de IA de una alternativa utilizada por necesidad bajo restricciones de exportación en un ecosistema informático realmente competitivo. Ejecutar un modelo de alto uso sobre aceleradores chinos representa un paso importante, pero el rendimiento de entrenamiento, la eficiencia energética y la validación independiente seguirán siendo pruebas decisivas.