09/18/2026, 11.18 · 👁 1
Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp

Tencent Hy4: Modelul de 770 miliarde parametri ajunge pe laptop

Tencent lansează Hy4 preview, un model AI masiv optimizat prin cuantizarea Sherry. Află cum 1.5TB de date au fost reduse la 214GB pentru rulare locală.
Tencent Hy4: Modelul de 770 miliarde parametri ajunge pe laptop
Pe scurt
  • Tencent a lansat Hy4 preview, un model open-source cu 770 miliarde de parametri și o fereastră de context de 1 milion de tokeni.
  • Tehnologia de cuantizare Sherry a redus dimensiunea modelului de la 1.5TB la 214GB, o scădere de 86%.
  • Modelul poate rula pe configurații locale hibride, inclusiv laptopuri cu RTX 4090, prin inferență distribuită.
  • Hy4 este optimizat pentru inginerie software complexă, dezvoltare de jocuri și cercetare științifică.

Accesul la modelele de inteligență artificială de frontieră a fost, până recent, rezervat entităților cu bugete colosale și centre de date dotate cu mii de GPU-uri. Totuși, lansarea modelului Hy4 preview de la Tencent marchează un punct de cotitură în democratizarea puterii de calcul. Nu este vorba doar despre un nou model performant, ci despre o schimbare de paradigmă în modul în care modelele masive pot fi implementate local, fără a depinde exclusiv de infrastructuri cloud costisitoare.

Arhitectura Hy4 și promisiunea open-source

Lansat pe 28 august 2026, Hy4 preview nu este un model convențional. Cu un total de 770 de miliarde de parametri, acesta utilizează o arhitectură de tip Mixture of Experts (MoE), ceea ce înseamnă că, deși dimensiunea totală este imensă, doar 49 de miliarde de parametri sunt activi pentru fiecare token generat. Această eficiență structurală este completată de o fereastră de context impresionantă, care depășește un milion de tokeni, permițând modelului să proceseze volume masive de date într-o singură sesiune.

Tencent a ales o strategie agresivă de distribuție, publicând modelul sub licența Apache 2.0. Aceasta permite dezvoltatorilor și antreprenorilor să integreze Hy4 în propriile fluxuri de lucru prin Tencent Cloud, OpenRouter sau direct din depozitele publice. Focusul principal al modelului este orientat către sarcini de înaltă complexitate: ingineria software pe termen lung, analiza de documente voluminoase pentru office, dezvoltarea de jocuri și cercetarea științifică în domenii precum fizica materiei condensate sau matematica pură.

Metoda Sherry: Reducerea drastică a amprentei hardware

Provocarea majoră a oricărui model de 770 de miliarde de parametri este memoria. În formatul original BF16, greutățile modelului ocupă aproximativ 1.5TB, o cifră care îl face imposibil de rulat pe orice hardware comercial standard. Aici intervine echipa AngelSlim de la Tencent, care a dezvoltat o metodă de cuantizare numită Sherry.

Spre deosebire de cuantizarea uniformă, Sherry aplică niveluri de precizie diferite în funcție de sensibilitatea fiecărui strat al modelului. Straturile non-critice sunt comprimate până la aproximativ 1.31 biți, în timp ce straturile sensibile păstrează o precizie de 2 biți sau mai mult. Rezultatul este o medie de aproximativ 2.38 biți per greutate (bpw), care reduce dimensiunea modelului la 214GB, reprezentând o tăiere de 86% din spațiul necesar.

Impactul real nu este doar stocarea, ci posibilitatea ca un laborator mic sau un antreprenor individual să poată manipula fișiere GGUF de 214GB, transformând un model de frontieră într-un instrument accesibil local.

Performanță versus compresie: Ce se pierde în proces?

O întrebare critică pentru orice business este dacă această compresie extremă afectează calitatea output-ului. Datele furnizate de Tencent sugerează că pierderea de performanță este minimă. În benchmark-urile interne, versiunea cuantizată a scăzut între 0.2 și 1.6 puncte față de originalul BF16. Mai mult, pe SWE-bench Pro, pierderea de performanță a fost de doar 0.7%.

În ceea ce privește capacitățile practice, Hy4 preview a fost testat în scenarii de programare complexă, unde a demonstrat abilitatea de a planifica, depana și verifica codul pe sesiuni extinse. Într-o comparație blindă realizată de 163 de experți Tencent pe 203 sarcini de inginerie, Hy4 a obținut o medie de 2.99, poziționându-se ușor peste competitori precum GLM 5.3 și Kimi K3. Modelul poate chiar să creeze prototipuri de jocuri funcționale dintr-un singur prompt, rafinând proiectul ulterior în motoarele de joc.

Rularea pe laptop și inferența hibridă

Deși titlurile sugerează că un laptop cu RTX 4090 poate rula singur modelul, realitatea tehnică este mai nuanțată. Pentru a menține modelul complet în VRAM, sunt necesari tot aproximativ 214 GiB, ceea ce depășește capacitatea oricărui laptop actual. Totuși, optimizările AngelSlim permit utilizarea unor setup-uri de inferență patch-uite, care nu sunt disponibile în versiunile standard de llama.cpp.

Cea mai interesantă abordare este inferența hibridă (joint inference) realizată cu prima.cpp. Tencent a testat o configurație mixtă formată dintr-un laptop cu RTX 4090 și un server cu 4x A4000, totalizând 80GB VRAM și 64GB RAM. Această distribuție a sarcinii a generat o viteză de 1.02 tokeni pe secundă, o performanță de aproximativ 6 ori mai rapidă decât dacă modelul ar fi fost rulat prin offloading exclusiv pe laptop. Această capacitate de a partaja sarcina de calcul între dispozitive eterogene deschide uși pentru companiile care nu au servere masive, dar au mai multe stații de lucru performante.

Costuri și accesibilitate pentru dezvoltatori

Pentru cei care preferă nu să gestioneze infrastructura locală, Tencent a stabilit o structură de prețuri competitivă pentru API-ul Hy4 preview. Costurile sunt segmentate pentru a încuraja utilizarea eficientă a memoriei cache:

Input cache: 0.042 USD per milion de tokeni; Input standard: 0.834 USD per milion de tokeni; Output: 2.501 USD per milion de tokeni. Această strategie de preț, combinată cu disponibilitatea open-source, pune presiune pe furnizorii de modele proprietare, oferind o alternativă puternică pentru companiile care au nevoie de capacități de raționament avansat în software și cercetare.

Impactul strategic pentru ecosistemul digital din România

Pentru antreprenorii și companiile de IT din România, disponibilitatea unui model de 770 de miliarde de parametri care poate fi rulat pe hardware accesibil reprezintă o oportunitate majoră de accelerare a digitalizării. În contextul AI Act, capacitatea de a rula modelele local (on-premise) devine un avantaj critic pentru conformitate, deoarece datele sensibile ale clienților nu mai trebuie să părăsească infrastructura companiei pentru a fi procesate de un LLM de frontieră.

În România, unde sectorul de outsourcing software este unul dintre pilonii economiei, Hy4 preview poate fi integrat în fluxurile de lucru pentru a automatiza debugging-ul și planificarea arhitecturală a proiectelor complexe. Mai mult, fondurile din PNRR destinate digitalizării întreprinderilor pot fi acum direcționate către achiziția de hardware de calcul local (precum stații de lucru cu GPU-uri NVIDIA seria 40), știind că există modele open-source capabile să ruleze pe aceste configurații prin tehnici de cuantizare.

Trecerea de la dependența totală de API-urile americane către soluții hibride sau locale reduce riscurile operaționale și costurile pe termen lung. Pentru o firmă de software din București sau Cluj, posibilitatea de a avea un asistent de codificare cu 770 de miliarde de parametri rulând pe un cluster de laptopuri performante transformă AI-ul dintr-o cheltuială lunară de abonament într-un activ tehnologic propriu.

Întrebări frecvente

Poate un laptop obișnuit să ruleze Hy4 preview?

Nu în totalitate. Deși modelul este comprimat la 214GB, acesta necesită o cantitate similară de VRAM pentru a rula eficient. Totuși, poate fi rulat prin inferență distribuită pe mai multe dispozitive sau prin offloading, dar cu viteze reduse.

Ce este metoda de cuantizare Sherry?

Este o tehnică dezvoltată de echipa AngelSlim care reduce precizia greutăților modelului (în medie la 2.38 biți), adaptând nivelul de compresie în funcție de importanța fiecărui strat, reducând astfel dimensiunea modelului de la 1.5TB la 214GB.

În ce domenii este cel mai util modelul Hy4?

Este optimizat pentru sarcini complexe de inginerie software, dezvoltarea de prototipuri pentru jocuri, analiză financiară și cercetare științifică avansată.

Este Hy4 un model gratuit?

Versiunea preview este open-source sub licența Apache 2.0, ceea ce înseamnă că poate fi descărcat și utilizat gratuit. Există însă costuri asociate dacă se alege utilizarea acestuia prin API-ul Tencent Cloud.


Surse: Startupfortune, Lookonchain, Testingcatalog ·

Hai una domanda su questo dossier?

Scrivila qui: Susanna, l assistente AI di glacom, ti risponde via email con un approfondimento gratuito.

Nessuna consulenza personalizzata (finanziaria, legale o medica): solo informazione e fonti. Email usata solo per rispondere.

oppure scrivile su: WhatsApp · Telegram · SimpleX · Delta Chat · Email

Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp
Printable version
CLOSE X
Distribuie această știre
See also
Recuperarea pozițiilor în Google: de ce durează luni de zile
Google avertizează că recuperarea traficului după erori SEO sau update-uri algoritmice nu este instantanee. Află cauzele scăderilor și strategiile de …
18/09/2026 09:25
Alianțe și riscuri în AI: Strategiile giganților tech pentru Europa
OpenAI, Google și Meta își schimbă tacticile. De la acceleratorul F/ai din Paris până la riscurile de securitate cibernetică, iată ce înseamnă pentru …
18/09/2026 07:54
Curățarea AI slop: Noua piață a freelancerilor și riscurile business-ului
Cererea pentru corectarea conținutului generat de AI a crescut masiv. Află cum AI slop afectează freelancerii și ce înseamnă acest trend pentru firmel…
17/09/2026 19:38
Etichetarea conținutului AI: Lecții din Spania și impactul în România
Spania implementează reguli stricte pentru marcarea conținutului generat de AI. Află cum influențează aceste norme AI Act și ce înseamnă pentru firmel…
17/09/2026 17:52
Spania propune un pact national pentru IA: model de guvernare digitală
Guvernul spaniol inițiază un nou contract social pentru inteligența artificială. Află cum acest pact național influențează strategiile de business din…
17/09/2026 16:14