Gadgets y Hardware

China apuesta por la IA descomunal mientras domina los modelos pequeños

China apuesta por la IA descomunal mientras domina los modelos pequeños

China acaba de entrar en una carrera silenciosa pero decisiva: no solo quiere ganar en eficiencia de inteligencia artificial, sino también en escala bruta. Mientras empresas como Alibaba y ByteDance perfeccionan modelos diminutos que corren en teléfonos, preparan en paralelo sistemas tan grandes que harían que GPT-4 se vea modesto.

Índice
  1. De lo compacto a lo colosal
  2. ¿Por qué esos números no significan lo que crees?
  3. Más grande no es sinónimo de mejor
  4. La siguiente frontera: 10 billones
  5. Una estrategia de dos velocidades

De lo compacto a lo colosal

La estrategia china es curiosa porque parece contradictoria, pero no lo es. Durante años, startups y gigantes de Pekín ganaron relevancia internacional con familias de modelos como Qwen y MiniCPM: sistemas optimizados para funcionar con menos memoria, menos poder de procesamiento, en cualquier dispositivo. Era la respuesta lógica a las limitaciones de infraestructura comparadas con Silicon Valley.

Pero en 2024 y 2025 algo cambió de dirección. A la vez que esos modelos pequeños siguen evolucionando, las mismas empresas comenzaron a invertir en lo opuesto: gigantes de parámetros que rompen cifras cada semestre. DeepSeek lanzó V3 con 671 mil millones de parámetros. Moonshot AI llevó Kimi K2 hasta un billón completo. Y el salto se aceleró en 2026: Kimi K3 alcanzó 2,8 billones de parámetros, mientras Alibaba posicionó Qwen 3.8-Max en 2,4 billones.

¿Por qué esos números no significan lo que crees?

Aquí viene el detalle técnico que cambia toda la interpretación: esos números no son toda la historia. Un modelo de 2,4 billones de parámetros no usa 2,4 billones de parámetros en cada operación. Ese es el tamaño total, la capacidad instalada. Lo que realmente procesa por paso es mucho menor.

La razón es una arquitectura llamada Mixture of Experts, o MoE. En lugar de activar todo el cerebro del modelo todo el tiempo, el sistema decide qué partes usar según la tarea. Qwen 3.8-Max lo ilustra: tiene 2,4 billones de parámetros totales, pero activa solo unos 95 mil millones por paso. Es como un edificio gigante con varias alas: no necesitas ocupar todas simultáneamente.

OpenAI probable use algo similar en GPT-4 (un análisis de 2023 de SemiAnalysis lo sugiere), pero nunca lo confirmó públicamente. La arquitectura no es nueva, pero su escala en el ecosistema chino sí.

Más grande no es sinónimo de mejor

Aquí viene un recordatorio incómodo para la industria: acumular parámetros no garantiza un modelo superior. DeepMind lo demostró en 2022 con Chinchilla, un modelo de 70 mil millones de parámetros que superó a Gopher —que tenía 280 mil millones— en casi todas las pruebas. El secreto no fue solo el tamaño, sino el entrenamiento con cuatro veces más datos y una arquitectura pensada diferente.

Lo que importa entonces es la combinación: cantidad de parámetros, calidad de los datos de entrenamiento, poder computacional disponible y diseño arquitectónico. China parece haberlo entendido bien: no abandona los modelos pequeños, simplemente abre un segundo frente.

La siguiente frontera: 10 billones

Alibaba confirmó oficialmente que Qwen 4 está en entrenamiento desde septiembre de 2025. Pero no se detiene ahí: la hoja de ruta de la compañía menciona Qwen 4.5 y Qwen 5 con modelos proyectados entre 5 y 10 billones de parámetros.

ByteDance, según reportes de Financial Times, estaría en un camino similar, aunque aún no lo confirma públicamente. Mientras tanto, desde Estados Unidos, ni OpenAI ni Anthropic revelan los números exactos de parámetros de sus modelos más recientes. GPT-5.6 Sol y Claude Fable 5.1 permanecen en el misterio especulativo.

Una estrategia de dos velocidades

Lo que está sucediendo en China no es un cambio de rumbo, sino una bifurcación de inversión. Los modelos pequeños siguen siendo críticos: su valor radica en la eficiencia, en poder desplegar IA en lugares donde la infraestructura es limitada o los costos de procesamiento son prohibitivos. Son la democratización del acceso a la inteligencia artificial.

Los modelos colosales persiguen otra cosa: capacidad bruta para tareas complejas, multidisciplinarias, que exigen más “razonamiento”. Requieren mucha infraestructura, mucha energía, mucho dinero. Pero para empresas como Alibaba o ByteDance, que tienen esos recursos, tiene sentido apostar en ambos frentes: productos eficientes para el consumidor masivo y máquinas de poder bruto para aplicaciones empresariales exigentes.

El efecto colateral es que la competencia global en IA se está redefiniendo. Ya no es solo quién construye el modelo más grande, sino quién logra dominar el espectro completo: desde dispositivos de bolsillo hasta centros de datos descomunales.

Con información de Xataka.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *