Tencent Hy4: la IA de 770 mil millones de parámetros llega al PC

- Tencent libera Hy4 preview, un modelo de 770 mil millones de parámetros bajo licencia Apache 2.0.
- El equipo AngelSlim reduce el peso del modelo de 1,5 TB a 214 GB mediante el método de cuantización Sherry.
- La optimización permite la inferencia en hardware local, como laptops con RTX 4090, mediante configuraciones parcheadas.
- El modelo destaca en ingeniería de software, desarrollo de videojuegos y análisis financiero complejo.
La barrera entre los modelos de inteligencia artificial de escala frontera y la capacidad de cómputo local acaba de sufrir una grieta significativa. Tencent ha presentado Hy4 preview, un modelo masivo de 770 mil millones de parámetros que, hasta hace muy poco, habría requerido una infraestructura de servidores industriales para su despliegue. Sin embargo, la verdadera noticia no reside solo en la potencia bruta del modelo, sino en la capacidad de comprimirlo para que sea manejable en entornos mucho más modestos.
El salto técnico de los 1,5 terabytes a los 214 gigabytes
El despliegue original de Hy4 preview representaba un desafío logístico: sus pesos en formato BF16 ocupaban aproximadamente 1,5 TB. Para cualquier empresa o laboratorio de tamaño medio, mover y cargar un archivo de tal magnitud es una tarea prohibitiva. Aquí es donde entra en juego el equipo AngelSlim de Tencent, que ha desarrollado un método de cuantización denominado Sherry. Esta técnica ha logrado reducir el tamaño del modelo a 214 GB, lo que supone un recorte del 86% en el espacio necesario.
A diferencia de los procesos de cuantización uniforme, donde todo el modelo se reduce a la misma precisión, Sherry aplica un enfoque selectivo. El sistema identifica qué capas del modelo son más sensibles a la pérdida de precisión y cuáles no. Mientras que las capas no críticas se comprimen hasta alcanzar aproximadamente 1,31 bits, las capas sensibles mantienen una precisión de 2 bits o superior. El resultado es un promedio de 2,38 bits por peso (bpw) que mantiene la integridad del razonamiento del modelo.
Rendimiento real frente a la compresión extrema
La gran pregunta para cualquier emprendedor tecnológico es cuánto se pierde en el camino hacia la eficiencia. Los datos indican que el sacrificio es mínimo. En el benchmark SWE-bench Pro, la versión comprimida solo registró una pérdida de rendimiento del 0,7%. Otros cuatro indicadores proporcionados por Tencent muestran caídas que oscilan entre los 0,2 y los 1,6 puntos en comparación con la versión original de BF16.
Este equilibrio permite que un modelo con 770 mil millones de parámetros totales (de los cuales 49 mil millones están activos por token) pueda operar en configuraciones de hardware que antes eran impensables. Si bien es cierto que para una residencia completa del modelo STQ1_0 se siguen necesitando unos 214 GiB de VRAM, la posibilidad de ejecutarlo en entornos locales parcheados abre una puerta al despliegue privado de IA de alta capacidad.
Capacidades diseñadas para el entorno productivo
Hy4 preview no ha sido entrenado como un chatbot generalista, sino que su arquitectura ha sido moldeada con datos provenientes de ingenieros de software, analistas financieros, expertos en seguridad y desarrolladores de videojuegos de Tencent. Esta especialización se traduce en competencias muy concretas que interesan al sector business:
En el ámbito del software, el modelo es capaz de planificar, depurar y verificar el trabajo en sesiones extendidas, con un enfoque particular en la calidad visual del front-end. En el sector financiero, puede transformar archivos dispersos en hojas de cálculo y modelos financieros complejos. Incluso en el desarrollo de videojuegos, Hy4 puede crear prototipos jugables a partir de un único prompt y refinarlos iterativamente dentro de motores de juego.
El modelo puede juzgar la dirección de una investigación, organizar experimentos e iterar en trabajos de I+D complejos, superando en varios benchmarks a herramientas independientes como Codex.
La estrategia de despliegue y el acceso abierto
Tencent ha optado por una estrategia de apertura agresiva, liberando el modelo bajo una licencia Apache 2.0. Esto permite que la comunidad y las empresas integren Hy4 en sus propios flujos de trabajo sin las restricciones habituales de los modelos cerrados. El acceso está disponible a través de Tencent Cloud TokenHub, OpenRouter y repositorios públicos.
Para quienes prefieren el consumo vía API, la estructura de precios se ha definido de la siguiente manera: 0,042 dólares por millón de tokens de entrada en caché, 0,834 dólares para entrada estándar y 2,501 dólares para la salida de texto. Esta flexibilidad permite a las empresas escalar desde una prueba local en una estación de trabajo hasta una implementación masiva en la nube.
Inferencia híbrida: el fin del monopolio de la VRAM
Uno de los puntos más disruptivos es la implementación de la inferencia conjunta en dispositivos heterogéneos mediante prima.cpp. Tencent ha demostrado que es posible repartir la carga de trabajo entre diferentes máquinas. En una prueba concreta, se utilizó una laptop con una RTX 4090 combinada con un servidor de cuatro A4000. A pesar de contar con solo 80 GB de VRAM total y 64 GB de RAM, el sistema alcanzó una velocidad de 1,02 tokens por segundo.
Este resultado es aproximadamente seis veces más rápido que intentar ejecutar el modelo mediante offloading únicamente en la laptop. Esta capacidad de compartir la carga de inferencia entre múltiples dispositivos con configuraciones distintas democratiza el acceso a modelos de escala frontera, permitiendo que pequeñas empresas utilicen hardware existente para ejecutar tareas de razonamiento complejo.
Impacto y perspectivas para el tejido empresarial español
Para las empresas en España, la llegada de modelos como Hy4 preview bajo licencia abierta representa una oportunidad estratégica en el marco de la Agenda Digital Española. La capacidad de ejecutar un modelo de 770B de parámetros en hardware local o en nubes privadas es fundamental para aquellas compañías que manejan datos sensibles y que, por normativa, deben cumplir estrictamente con el Reglamento General de Protección de Datos (RGPD) y las directrices del AI Act de la Unión Europea.
El tejido empresarial español, compuesto mayoritariamente por PYMES, a menudo se enfrenta a la barrera del coste de las APIs de modelos cerrados o a la falta de infraestructura para desplegar modelos masivos. La cuantización extrema de Tencent permite que una consultora tecnológica en Madrid o una startup de software en Barcelona pueda implementar capacidades de ingeniería de software y análisis financiero de nivel frontera sin necesidad de invertir millones en clusters de GPUs H100.
Además, la compatibilidad con entornos locales reduce la dependencia de proveedores externos no europeos, alineándose con la soberanía tecnológica que busca la UE. La posibilidad de ajustar estos modelos a procesos industriales específicos, aprovechando que Hy4 ya viene pre-entrenado en tareas de I+D y desarrollo técnico, podría acelerar la digitalización de sectores clave en España, desde la ingeniería civil hasta la gestión de activos financieros.
Preguntas frecuentes
¿Puede cualquier laptop ejecutar Hy4 preview?
No cualquier laptop. Requiere hardware potente, como una RTX 4090, y el uso de versiones cuantizadas (GGUF) con parches específicos, ya que no es compatible con la versión estándar de llama.cpp.
¿Qué es la cuantización Sherry?
Es un método desarrollado por el equipo AngelSlim de Tencent que reduce el peso del modelo aplicando diferentes niveles de precisión según la sensibilidad de cada capa, logrando bajar de 1,5 TB a 214 GB.
¿En qué tareas destaca especialmente este modelo?
Hy4 preview es especialmente fuerte en ingeniería de software (depuración y planificación), desarrollo de videojuegos, análisis financiero y research científico en matemáticas y física.
¿Cuál es la licencia de Hy4 preview?
El modelo ha sido liberado bajo la licencia Apache 2.0, lo que facilita su uso y adaptación en entornos comerciales y abiertos.
Fuentes: Startupfortune, Lookonchain, Testingcatalog ·
glacom · Inteligencia artificial para empresas: los modelos corren en tus servidores, los datos no salen →Scrivila qui: Susanna, l assistente AI di glacom, ti risponde via email con un approfondimento gratuito.
Nessuna consulenza personalizzata (finanziaria, legale o medica): solo informazione e fonti. Email usata solo per rispondere.
oppure scrivile su: WhatsApp · Telegram · SimpleX · Delta Chat · Email












