Tencent Hy4: la compressió extrema que democratitza la IA de frontera

- Tencent ha llançat Hy4 preview, un model de 770 milions de paràmetres amb llicència Apache 2.0.
- La tècnica de quantització Sherry redueix el pes del model de 1,5TB a 214GB (una caiguda del 86%).
- El model pot executar-se en configuracions locals, incloent portàtils amb RTX 4090 i sistemes heterogènies.
- Hy4 destaca en enginyeria de programari, desenvolupament de videojocs i recerca científica complexa.
L'accés a la intel·ligència artificial de frontera ha estat, fins ara, un privilegi reservat a entitats amb centres de dades massius o pressupostos milionaris per pagar APIs. Tanmateix, el llançament de Hy4 preview per part de Tencent marca un canvi de paradigma. No es tracta només de la potència bruta d'un model de 770 milions de paràmetres, sinó de la capacitat de portar aquesta potència a hardware que, fins ahir, es considerava insuficient.
La arquitectura de Hy4 i la seva visió open-source
Tencent ha presentat Hy4 preview com el seu model més capaç fins al moment, amb una estructura de Mixture of Experts (MoE) que gestiona 770 milions de paràmetres totals, dels quals 49 milions estan actius per token. Una de les seves característiques més impactants és la finestra de context, que supera el millón de tokens, permetent processar volums de dades massius en una sola sessió.
El model ha estat alliberat sota una llicència Apache 2.0, el que facilita la seva adopció per a desenvolupadors i empreses. Està disponible a través de Tencent Cloud, OpenRouter i diversos repositoris públics. L'objectiu és clar: optimitzar tasques de llarg termini en enginyeria de programari, recerca científica en física de la matèria condensada i matemàtiques pures, així com el desenvolupament de videojocs.
Sherry: el secret de la compressió extrema
El verdadero salt tecnològic no resideix només en el model, sinó en com es pot desplegar. L'equip AngelSlim de Tencent ha desenvolupat un mètode de quantització anomenat Sherry. Aquesta tècnica ha permès reduir el pes dels pesos originals del model, que ocupaven uns 1,5TB en format BF16, fins a uns 214GB en la versió GGUF (específicament el build STQ1_0).
Aquesta reducció del 86% no s'ha fet de manera uniforme, cosa que ha evitat un col·lapse en el rendiment. En lloc d'aplicar una quantització plana, Sherry analitza la sensibilitat de cada capa del model. Les capes no crítiques es comprimen fins a uns 1,31 bits, mentre que les capes més sensibles mantenen una precisió de 2 bits o superior. El resultat és una mitjana de 2,38 bits per pes (bpw), aconseguint que la pèrdua de rendiment en el benchmark SWE-bench Pro sigui de només el 0,7%.
Execució local en hardware no convencional
La possibilitat de fer rodar un model d'aquesta escala en un portàtil amb una GPU RTX 4090 ha generat un gran impacte. Tot i així, cal ser precisos: no significa que qualsevol portàtil es converteixi en un supercomputador d'IA. La residència completa del model STQ1_0 encara requereix uns 214 GiB de VRAM, i l'execució demanda patches específics per a llama.cpp, ja que l'arquitectura de Hy4 no és compatible amb les versions estàndard.
L'aspecte més interessant per als emprenedors tecnològics és l'inferència conjunta en dispositius heterogènies. Utilitzant prima.cpp, Tencent ha demostrat que una combinació d'un portàtil RTX 4090 i un servidor amb 4-A4000 (amb un total de 80GB de VRAM i 64GB de RAM) pot assolir una velocitat d'inferència d'1,02 tokens per segon. Aquesta configuració és sis vegades més ràpida que executar el model amb offloading només al portàtil, demostrant que el càrrec de treball es pot distribuir entre diversos dispositius amb configuracions diferents.
L'estratègia de Tencent amb Hy4 no és només crear un model potent, sinó trencar la barrera del hardware de frontera per permetre que laboratoris més petits i empreses locals puguin manipular pesos de 770 milions de paràmetres.
Capacitats operatives i rendiment real
Hy4 preview ha estat entrenat amb dades específiques de programadors, analistes financers i experts en seguretat de la pròpia empresa. Això es tradueix en una capacitat superior per planificar, depurar i verificar codi en sessions prolongades. En el camp dels videojocs, el model pot crear prototips jugables a partir d'un únic prompt i iterar sobre projectes complexos dins de motors gràfics.
En comparacions cegues realitzades per 163 experts de Tencent en 203 tasques d'enginyeria, Hy4 ha obtingut una puntuació mitjana de 2,99, superant lleugerament a GLM 5.3 (2,92) i Kimi K3 (2,94). Tot i aquests èxits, Tencent admet que el model es troba en una fase preliminar i que, en tasques complexes, pot arribar a raonar més del necessari o a sobre-verificar la seva pròpia feina.
Pel que fa als costos per a qui prefereix l'accés via API, els preus s'estableixen en 0,042 $ per milió de tokens per a entrades amb caché, 0,834 $ per a entrades estàndard i 2,501 $ per a la generació de sortida.
L'impacte en l'ecosistema empresarial de Catalunya i Espanya
La democratització del hardware per a models de gran escala té implicacions directes per a l'ecosistema tech de Barcelona i el mercat espanyol. Històricament, les startups catalanes han depenès de proveïdors de núvols americans o xinesos, cosa que implicava costos operatius elevats i dependència externa. La possibilitat de desplegar models com Hy4 en infraestructura local o híbrida permet un control molt més gran sobre la privacitat de les dades, un punt crític per a les empreses que operen sota el marc de l'AI Act de la Unió Europea.
L'AI Act imposa requisits estrictos de transparència i governança de dades. El fet que Hy4 sigui open-source i pugui executar-se localment facilita que les empreses espanyoles puguin auditar el comportament del model sense que la informació sensible hagi de sortir dels seus servidors. Per a les consultories de programari i els estudis de videojocs a Catalunya, l'ús de models especialitzats en enginyeria de programari que no requereixin una inversió massiva en H100 de NVIDIA pot accelerar dràsticament els cicles de desenvolupament.
A més, la capacitat de distribuir la càrrega d'inferència entre dispositius heterogènies obre la porta a solucions de computació distribuïda per a PIMES que no poden permetre's un cluster de GPUs de última generació, però que disposen de hardware divers en les seves oficines. Això podria convertir Barcelona en un hub encara més atractiu per al desenvolupament d'aplicacions d'IA de frontera amb costos d'infraestructura optimitzats.
Preguntes freqüents
Què és exactament la tècnica Sherry?
És un mètode de quantització desenvolupat per l'equip AngelSlim de Tencent que redueix el pes dels models d'IA. A diferència de la quantització uniforme, Sherry aplica diferents nivells de precisió segons la sensibilitat de cada capa del model, permetent reduir el pes de Hy4 de 1,5TB a 214GB amb una pèrdua mínima de rendiment.
Es pot executar Hy4 en un portàtil gaming estàndard?
Sí, és possible executar-lo en un portàtil amb una RTX 4090, però requereix patches específics per a llama.cpp i una quantitat considerable de VRAM (uns 214 GiB per a la versió STQ1_0). Per a un rendiment realment útil, es recomana l'ús d'inferència conjunta amb altres dispositius.
En quines tasques destaca més el model Hy4 preview?
El model està optimitzat per a l'enginyeria de programari de llarg termini, el desenvolupament de prototips de videojocs, l'anàlisi de documents complexos (finances i equacions) i la recerca científica en matemàtiques i física.
Quina llicència té el model Hy4?
Tencent ha alliberat Hy4 preview sota una llicència Apache 2.0, cosa que permet l'ús i la modificació del model per a diversos propòsits.
Fonts: Startupfortune, Lookonchain, Testingcatalog ·
glacom · Intel·ligència artificial per a empreses: els models corren als teus servidors, les dades no surten →Scrivila qui: Susanna, l assistente AI di glacom, ti risponde via email con un approfondimento gratuito.
Nessuna consulenza personalizzata (finanziaria, legale o medica): solo informazione e fonti. Email usata solo per rispondere.
oppure scrivile su: WhatsApp · Telegram · SimpleX · Delta Chat · Email