09/18/2026, 11.18 · 👁 1
Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp

Tencent Hy4 : l'IA géante de 770 milliards de paramètres devient locale

Tencent réduit son modèle Hy4 de 1,5 To à 214 Go grâce à la quantification Sherry. Une avancée majeure pour le déploiement local de l'IA frontière.
Tencent Hy4 : l'IA géante de 770 milliards de paramètres devient locale
En bref
  • Tencent a publié Hy4 preview, un modèle massif de 770 milliards de paramètres sous licence Apache 2.0.
  • La méthode de quantification Sherry réduit la taille du modèle de 86%, passant de 1,5 To à 214 Go.
  • Le modèle peut désormais fonctionner sur du matériel accessible, comme un ordinateur portable RTX 4090 via des configurations patchées.
  • Hy4 excelle dans le génie logiciel, la recherche scientifique et le développement de jeux vidéo.

L'industrie de l'intelligence artificielle franchit un nouveau cap dans la démocratisation des modèles dits de frontière. Tencent vient de dévoiler Hy4 preview, un modèle colossal de 770 milliards de paramètres, tout en proposant simultanément une solution technique pour briser la barrière matérielle qui rendait jusqu'ici l'exécution locale de tels systèmes quasi impossible pour les structures moyennes.

Une architecture massive pour des tâches complexes

Le modèle Hy4 preview ne se contente pas d'une taille impressionnante. Avec 49 milliards de paramètres actifs par token et une fenêtre de contexte dépassant le million de tokens, Tencent cible des segments de haute précision. L'objectif est clair : s'attaquer au génie logiciel à long terme, à la recherche scientifique en physique de la matière condensée et aux mathématiques pures, ainsi qu'au développement de jeux vidéo.

Selon les données fournies par TestingCatalog, Hy4 est capable de transformer des fichiers épars en documents structurés, feuilles de calcul ou présentations, incluant des modèles financiers et des équations complexes. En développement de jeux, il peut générer des prototypes jouables à partir d'un seul prompt et affiner le projet au sein de moteurs de jeu sur plusieurs itérations.

La méthode Sherry : l'art de la compression extrême

Le défi majeur de Hy4 résidait dans son poids initial. Avec des poids BF16 avoisinant les 1,5 To, le modèle était cantonné aux infrastructures de cloud massif. C'est ici qu'intervient l'équipe AngelSlim de Tencent avec Sherry, une méthode de quantification à 1,25 bit.

Loin d'une compression uniforme qui aurait dégradé la qualité des réponses, Sherry applique une approche sélective. Les couches non critiques du modèle sont compressées jusqu'à environ 1,31 bit, tandis que les couches sensibles conservent une précision de 2 bits ou plus. Cette stratégie permet d'atteindre une moyenne de 2,38 bits par poids (bpw), réduisant la taille totale du modèle à 214 Go, soit une coupe de 86%.

L'impact sur la performance est marginal. Sur le benchmark SWE-bench Pro, la perte de performance n'est que de 0,7%. Sur d'autres tests internes, la baisse varie entre 0,2 et 1,6 point par rapport à la version originale, prouvant que l'efficacité peut coexister avec la puissance.

L'IA de frontière sur un ordinateur portable ?

L'annonce a fait grand bruit en suggérant qu'un ordinateur portable équipé d'une RTX 4090 pourrait faire tourner Hy4. Cependant, une nuance technique s'impose. Si le fichier GGUF de 213,66 GiB peut être stocké, la résidence complète du modèle nécessite toujours environ 214 GiB de VRAM pour la version STQ1_0.

L'innovation réside moins dans l'utilisation d'une seule machine que dans la possibilité de déployer le modèle sur des configurations matérielles hétérogènes et moins coûteuses. Startup Fortune souligne que Hy4 peut désormais être intégré dans des installations d'inférence locale patchées, là où c'était auparavant impossible.

Tencent a testé l'inférence conjointe avec prima.cpp sur un setup composé d'un ordinateur portable RTX 4090 et d'un serveur 4-A4000. Avec seulement 80 Go de VRAM totale et 64 Go de RAM, le système a atteint une vitesse de 1,02 token par seconde.

Ce résultat est environ six fois plus rapide qu'une exécution déchargée sur un seul ordinateur portable, ouvrant la voie à un partage de la charge de travail entre plusieurs appareils de configurations différentes.

Comparaisons et performances sectorielles

Pour valider la pertinence de Hy4 preview, Tencent a organisé des tests en aveugle impliquant 163 experts sur 203 tâches d'ingénierie. Le modèle a obtenu une note moyenne de 2,99, se plaçant légèrement au-dessus de GLM 5.3 (2,92) et Kimi K3 (2,94).

Face à GLM 5.3, Hy4 a enregistré 46,8% de victoires, tandis que contre Kimi K3, il a dominé dans 51,2% des cas. Le modèle a également surpassé Codex sur huit benchmarks différents lors de tâches de post-entraînement sur de petits modèles, démontrant sa capacité à organiser des expériences et à itérer sur des travaux de R&D complexes.

Accessibilité et modèle économique

Tencent a choisi une stratégie d'ouverture avec une licence Apache 2.0, rendant Hy4 preview disponible via plusieurs canaux. Le modèle est accessible sur Tencent Cloud, OpenRouter, ainsi que via les produits Yuanbao et ima. Pour les entreprises souhaitant utiliser l'API, la tarification est segmentée comme suit :

  • Entrée mise en cache : 0,042 $ par million de tokens.
  • Entrée standard : 0,834 $ par million de tokens.
  • Sortie : 2,501 $ par million de tokens.

L'entreprise reconnaît toutefois que cette version preview peut parfois raisonner plus longtemps que nécessaire sur des tâches complexes ou sur-vérifier son propre travail, des points d'amélioration pour les versions futures.

L'impact stratégique pour les entreprises françaises

L'arrivée d'un modèle de 770 milliards de paramètres capable de tourner sur du matériel localisé change la donne pour le tissu entrepreneurial français. Dans un contexte où la souveraineté des données est primordiale, la possibilité de déployer une IA de niveau frontière sans dépendre entièrement d'un cloud américain ou chinois est un atout majeur.

Pour les PME et les startups françaises, notamment celles soutenues par le plan France 2030, cela réduit drastiquement les coûts d'infrastructure. L'utilisation de clusters de GPU modestes ou de serveurs hétérogènes permet d'accéder à des capacités de raisonnement complexes pour le développement logiciel ou la recherche scientifique sans investissements massifs dans des clusters H100.

Par ailleurs, le déploiement local facilite la mise en conformité avec l'AI Act européen. En gardant les données sensibles à l'intérieur de leurs propres serveurs, les entreprises peuvent limiter les risques liés au transfert de données transfrontalier tout en bénéficiant d'un modèle open-weight. La capacité de Hy4 à gérer des documents lourds et des analyses financières complexes pourrait particulièrement intéresser le secteur bancaire et les cabinets de conseil français, où la confidentialité est une exigence non négociable.

Questions fréquentes

Qu'est-ce que la quantification Sherry ?

C'est une méthode développée par l'équipe AngelSlim de Tencent qui réduit la précision des poids du modèle (jusqu'à 1,25 bit pour les couches non critiques) pour diminuer sa taille sans sacrifier significativement les performances.

Hy4 peut-il vraiment tourner sur un PC portable ?

Oui, mais avec des nuances. Le modèle compressé (214 Go) peut être chargé, mais pour une exécution fluide, il nécessite soit une VRAM massive, soit une configuration d'inférence distribuée (plusieurs machines) via des outils comme prima.cpp.

Quel est l'avantage de Hy4 par rapport aux autres modèles open-source ?

Sa taille massive (770B) et sa fenêtre de contexte d'un million de tokens le rendent particulièrement performant pour des tâches de long terme comme le codage de logiciels entiers ou la recherche scientifique complexe.


Sources: Startupfortune, Lookonchain, Testingcatalog ·

Hai una domanda su questo dossier?

Scrivila qui: Susanna, l assistente AI di glacom, ti risponde via email con un approfondimento gratuito.

Nessuna consulenza personalizzata (finanziaria, legale o medica): solo informazione e fonti. Email usata solo per rispondere.

oppure scrivile su: WhatsApp · Telegram · SimpleX · Delta Chat · Email

Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp
Printable version
CLOSE X
Partagez cet article
See also
Récupération SEO Google : pourquoi le retour au sommet prend des mois
Google avertit : corriger ses erreurs SEO ne suffit pas pour remonter instantanément. Analyse des délais de récupération et stratégies pour les entrep…
18/09/2026 09:25
F/ai : OpenAI, Google et Meta s'unissent à Paris pour l'IA
Les géants de la tech lancent F/ai avec Station F. Un accélérateur inédit pour propulser les startups européennes face à la concurrence mondiale.
18/09/2026 07:54
L'essor du nettoyage d'IA : le nouveau marché du freelance
Les offres d'emploi pour corriger les erreurs de l'IA explosent. Découvrez pourquoi le nettoyage du 'AI slop' devient un enjeu majeur pour les entrepr…
17/09/2026 19:38
IA en Espagne : vers une obligation stricte d'étiquetage des contenus
L'Espagne durcit le ton sur l'IA avec un projet de loi imposant l'identification des contenus synthétiques. Sanctions lourdes et enjeux pour l'UE.
17/09/2026 17:52
IA : l'Espagne lance un pacte national pour un nouveau contrat social
Le gouvernement espagnol propose un grand pacte national sur l'IA impliquant acteurs sociaux et politiques pour garantir une transition numérique just…
17/09/2026 16:14