Resumen
- Mobile Cloud y sus socios han combinado GPU nacionales y chips neuromórficos en un sistema de inferencia de IA que reparte los cálculos del modelo entre ambos procesadores
- Los desarrolladores informan de unos costes operativos más de un 40 % inferiores a los de un clúster comparable de GPU nacionales en pruebas con DeepSeek V4 Flash
Los hechos
La unidad Mobile Cloud de China Mobile y sus socios han lanzado un sistema de inferencia de IA que combina GPU nacionales con chips neuromórficos. El sistema se presentó durante la conferencia China Computing Conference en Langfang, Hebei, celebrada del 11 al 13 de septiembre.
El proyecto se desarrolló con CETC Nanhu Research Institute, Lynxi Technology, Iluvatar CoreX, Tsinghua University y Peking University. Los desarrolladores afirmaron que las pruebas con DeepSeek V4 Flash ofrecieron más del doble de rendimiento por unidad de coste y redujeron los costes operativos en más de un 40 % frente a un clúster similar de GPU nacionales. Las cifras proceden del equipo de desarrollo y no han sido verificadas de forma independiente.
El sistema reparte el trabajo entre los dos tipos de chip. Los cálculos de atención se ejecutan en GPU nacionales, mientras que las tareas de FFN se asignan a procesadores neuromórficos. Un compilador de modelos, un protocolo de interconexión de alta velocidad y un motor de inferencia común gestionan el reparto de tareas, la planificación y los resultados. Por separado, Iluvatar comunicó 654 millones de yuanes de ingresos por productos de inferencia en el primer semestre de 2026, equivalentes al 69,2 % de sus ingresos totales.
La evaluación
La idea es sencilla: no hacer que un solo tipo de procesador gestione cada parte del modelo. La GPU se encarga de las tareas adecuadas para un acelerador de uso general, mientras que el chip neuromórfico asume los cálculos que los desarrolladores creen que puede ejecutar con mayor eficiencia. Si ese reparto funciona en producción, un operador de servicios en la nube podría reducir el coste de atender solicitudes de IA sin sustituir toda su infraestructura de GPU.
Lo difícil es todo lo que ocurre entre los dos chips. Los datos deben moverse en el momento adecuado, el software debe decidir dónde se ejecuta cada cálculo y ningún procesador puede pasar demasiado tiempo esperando al otro. El ahorro medido con una única configuración de DeepSeek puede reducirse cuando las solicitudes son más largas, hay más tráfico o cambia el modelo.
Por tanto, la afirmación del 40 % requiere una comparación del sistema completo. Los clientes tendrían que ejecutar la misma carga de trabajo con el mismo tiempo de respuesta y la misma calidad de salida, incluyendo en el cálculo ambos procesadores, la interconexión y el software. Si el sistema mixto sigue teniendo un coste menor en esas condiciones, la arquitectura pasa a ser comercialmente interesante.
Qué observar
Las pruebas con clientes deberían mostrar el coste del sistema completo, el tiempo de respuesta y la capacidad de procesamiento, en lugar de otra cifra máxima de una prueba de rendimiento. Los resultados con varios modelos y patrones de tráfico mostrarían si el ahorro comunicado se mantiene fuera de la prueba con DeepSeek V4 Flash. Los pedidos comerciales o los despliegues de clientes de servicios en la nube y de clientes empresariales aportarían pruebas más sólidas que nuevas demostraciones.
Informe para miembros
Contexto ampliado del perfil
Inicia sesión con el nivel de membresía adecuado para desbloquear el informe completo y las notas de las fuentes.
Solo para Strategic Circle
Strategic Circle
Abierto a todos los lectores. Desbloquea informes de perfil después de unirte e iniciar sesión.
Únete a Strategic CircleSolo para Leadership Alliance
Leadership Alliance
Para propietarios y directivos cualificados de activos de propiedad intelectual; inicia sesión para desbloquear los informes de la alianza.
Unirse a Leadership Alliance

