18/09/2026, 11.18 · 👁 1
Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp

Tencent Hy4 e metodo Sherry: AI da 770 miliardi di parametri locale

Tencent riduce il modello Hy4 da 1.5TB a 214GB con il metodo Sherry. Analisi tecnica e business sulla democratizzazione dei pesi aperti per le imprese.
Tencent Hy4 e metodo Sherry: AI da 770 miliardi di parametri locale
In sintesi
  • Tencent ha rilasciato Hy4 preview, un modello MoE da 770 miliardi di parametri con finestra di contesto di 1 milione di token.
  • Il team AngelSlim ha sviluppato Sherry, un metodo di quantizzazione che riduce il peso del modello da 1.5TB a 214GB (taglio dell'86%).
  • La compressione permette l'esecuzione su hardware consumer (RTX 4090) tramite patch e inferenza eterogenea, con perdite di performance minime.
  • Il modello punta a verticalità business: software engineering, game dev, analisi finanziaria e ricerca scientifica.

Il limite fisico della memoria video (VRAM) è sempre stato il muro contro cui si è scontrata l'implementazione locale dei modelli di linguaggio di frontiera. Per un imprenditore, questo significava dipendere totalmente da API cloud o investire in cluster di GPU H100 da decine di migliaia di dollari. La mossa di Tencent con il rilascio di Hy4 preview e l'integrazione del toolkit AngelSlim sposta l'asse del possibile, portando un modello da 770 miliardi di parametri in un formato che può essere gestito da laboratori di medie dimensioni o workstation avanzate.

Il team AngelSlim e la sfida dei 214 gigabyte

La narrazione tecnica si concentra su un numero: 214GB. È la dimensione della build GGUF del modello Hy4-preview-STQ1_0, realizzata dal team AngelSlim di Tencent. Per comprendere l'entità dell'operazione, bisogna guardare al punto di partenza: i pesi originali in formato BF16 occupano circa 1.5TB. Senza l'intervento di AngelSlim, l'esecuzione di Hy4 richiederebbe un'infrastruttura server massiccia, rendendo il modello un asset puramente cloud.

L'obiettivo del team non è stato semplicemente ridurre lo spazio su disco, ma rendere il modello 'spostabile' e utilizzabile in contesti di inferenza locale. La pubblicazione di diverse versioni su Hugging Face — tra cui la Q4_K_M da 435.20 GiB e la UD-IQ1_M da 219.83 GiB — dimostra una strategia di segmentazione dell'hardware target. Tuttavia, è la versione STQ1_0 a ridefinire i confini, riducendo l'ingombro dell'86%.

Analisi strategica: Questa operazione non è un semplice esercizio di ottimizzazione, ma una mossa di posizionamento geopolitico e commerciale. Rendendo disponibile un modello di questa scala sotto licenza Apache 2.0, Tencent non solo sfida l'egemonia dei modelli chiusi, ma crea un ecosistema di dipendenza tecnologica basata su standard aperti, facilitando l'adozione di Hy4 in aziende che, per ragioni di privacy o sovranità dei dati, non possono affidarsi a server esterni.

Come funziona il metodo Sherry

La riduzione drastica delle dimensioni non è avvenuta tramite una compressione uniforme, che avrebbe devastato le capacità cognitive del modello. Il metodo Sherry adotta un approccio di quantizzazione differenziata. Invece di applicare lo stesso livello di compressione a tutti i 770 miliardi di parametri, Sherry analizza la sensibilità di ogni singolo layer.

I layer definiti non critici vengono compressi fino a circa 1.31-bit. Al contrario, i layer sensibili, quelli che custodiscono la logica complessa e le relazioni semantiche fondamentali, mantengono una precisione di 2-bit o superiore. Il risultato finale è una media di circa 2.38 bits per weight (bpw). Questo processo permette di mantenere l'integrità del ragionamento pur eliminando la ridondanza dei dati.

L'efficacia di questo metodo è confermata dai dati: in quattro benchmark forniti da Tencent, la versione quantizzata ha registrato un calo di performance compreso tra 0.2 e 1.6 punti rispetto all'originale BF16. Sul test specifico SWE-bench Pro, la perdita di prestazioni è stata di appena lo 0.7%.

1,5 terabyte ridotti all'86%

Il passaggio da 1.5TB a 214GB cambia radicalmente l'economia dell'inferenza. Un modello con 770 miliardi di parametri totali, di cui 49 miliardi attivi per token (architettura MoE - Mixture of Experts), è normalmente destinato a data center. La compressione di AngelSlim permette di ipotizzare scenari di deployment precedentemente impossibili.

Tuttavia, è necessario distinguere tra storage e residenza in memoria. Come indicato nella model card di AngelSlim, la piena residenza del modello STQ1_0 richiede comunque circa 214 GiB di VRAM. Questo significa che, sebbene il file sia scaricabile su un disco rigido comune, l'esecuzione fluida richiede hardware specifico o tecniche di offloading.

Per superare questo limite, Tencent ha testato l'inferenza congiunta su dispositivi eterogenei utilizzando prima.cpp. I risultati mostrano che un setup composto da un laptop con RTX 4090 e un server con 4-A4000 (per un totale di 80GB di VRAM e 64GB di RAM) può raggiungere una velocità di 1.02 token al secondo. Questa velocità è circa 6 volte superiore rispetto all'esecuzione del modello offloadata esclusivamente sul laptop.

Analisi business: Per un'impresa, questo significa che l'inferenza di un modello di frontiera può essere distribuita su un parco macchine esistente. Non è più necessario l'acquisto di un singolo super-computer, ma è possibile coordinare più workstation per condividere il carico di lavoro, abbattendo drasticamente il CAPEX iniziale per l'adozione di AI avanzate.

Perché un laptop da gaming non basta

Le testate generaliste hanno enfatizzato la possibilità di far girare Hy4 su un laptop da gaming, ma la realtà tecnica è più complessa. Un laptop con RTX 4090 non trasforma improvvisamente la macchina in una 'frontier-model box'. Il problema principale risiede nel fatto che le build GGUF di Hy4 non sono compatibili con le versioni stock di llama.cpp.

L'architettura di Hy4 e il supporto per STQ1_0 richiedono patch specifiche per funzionare. Senza queste modifiche al codice di inferenza, l'hardware, per quanto potente, rimane inutile. Inoltre, l'inferenza basata solo su laptop, senza il supporto di server esterni o l'uso di RAM di sistema (che è molto più lenta della VRAM), risulta inefficiente per utilizzi produttivi in tempo reale.

Il vero valore aggiunto non è l'esecuzione su un singolo laptop, ma la possibilità di inserire il modello in setup di inferenza locale patchati che prima erano fisicamente impossibili. La soglia di ingresso per l'utilizzo di modelli da 770B è stata abbassata, ma non eliminata.

L'intelligenza artificiale che scrive codice e crea giochi

Hy4 preview non è un modello generalista qualunque; è stato addestrato su dati provenienti da software engineer, sviluppatori di giochi, analisti finanziari ed esperti di sicurezza di Tencent. Questa specializzazione lo rende particolarmente efficace in quattro aree verticali: software engineering a lungo termine, lavoro d'ufficio basato su documenti pesanti, sviluppo di videogiochi e ricerca scientifica.

Nel campo del coding, il modello è progettato per pianificare, debuggare e verificare il lavoro attraverso sessioni estese, con un'attenzione particolare alla qualità visiva dell'output front-end. Tencent dichiara che Hy4 può generare prototipi giocabili partendo da un singolo prompt e affinare progetti complessi all'interno di game engine attraverso interazioni multiple.

La capacità di ragionamento è stata testata in contesti di R&S: il modello ha gestito sessioni Codex in parallelo, cambiando direzione di ricerca in base ai risultati ottenuti. In un test di post-training su modelli piccoli, Hy4 ha coordinato il lavoro su otto diversi target di valutazione, superando Codex che lavorava indipendentemente. Un confronto interno condotto da 163 esperti di Tencent su 203 task di ingegneria ha assegnato a Hy4 un punteggio medio di 2.99, superando GLM 5.3 (2.92) e Kimi K3 (2.94).

Tuttavia, Tencent ammette che Hy4 preview è una versione preliminare. Il modello tende a ragionare più a lungo del necessario su task complessi e a sovra-verificare il proprio lavoro, un comportamento che potrebbe rallentare la produttività in contesti di rapidità operativa.

Analisi critica: L'integrazione di Hy4 con strumenti come CodeBuddy e WorkBuddy suggerisce che Tencent non stia vendendo solo un modello, ma un workflow di produttività. Per le aziende di software e gaming, l'indicatore verificabile per l'adozione di massa sarà l'integrazione nativa di Hy4 nei principali IDE (Integrated Development Environment) entro i prossimi 12 mesi.

La democratizzazione dei pesi aperti tra AI Act e l'industria tech UE

Il rilascio di Hy4 sotto licenza Apache 2.0 e la sua disponibilità tramite Tencent Cloud TokenHub e OpenRouter pongono questioni cruciali per il mercato europeo. L'Unione Europea, attraverso l'AI Act, sta cercando di bilanciare l'innovazione con la sicurezza, ponendo vincoli severi ai modelli ad alto rischio.

Per le imprese italiane, l'accesso a modelli 'open-weight' di questa scala rappresenta un'opportunità strategica per ridurre la dipendenza dai provider USA. La possibilità di eseguire un modello da 770B localmente (o su cloud privato) permette di mantenere i dati aziendali all'interno del perimetro NIS2, evitando il trasferimento di informazioni sensibili verso server extra-UE.

Tuttavia, l'adozione di modelli cinesi in infrastrutture critiche europee potrebbe scontrarsi con nuove normative sulla cybersecurity e sulla provenienza dei dati di addestramento. La sfida per l'industria tech UE sarà quella di sviluppare toolkit di compressione simili a AngelSlim per i propri modelli, evitando che la 'democratizzazione' dell'AI sia guidata esclusivamente da player asiatici o americani.

L'indicatore chiave per l'Europa sarà l'eventuale rilascio di framework di conformità AI Act specifici per i modelli open-weight di grandi dimensioni entro il 2027. Se l'UE non fornirà linee guida chiare sulla responsabilità legale di chi deploya localmente modelli di terze parti, le imprese italiane potrebbero esitare ad adottare Hy4 nonostante l'efficienza tecnica.

Sintesi tecnica Hy4 Preview

Metrica Valore Originale (BF16) Valore Quantizzato (Sherry/STQ1_0)
Dimensione Pesi ~1.5 TB 213.66 GiB
Parametri Totali 770 Miliardi 770 Miliardi
Parametri Attivi/Token 49 Miliardi 49 Miliardi
Perdita Performance (SWE-bench Pro) 0% (Baseline) 0.7%
VRAM Necessaria (Residenza) ~1.5 TB ~214 GiB

Domande frequenti

Posso far girare Hy4 sul mio laptop con una RTX 4090 senza modifiche?

No. Sebbene la dimensione sia ridotta, sono necessarie patch specifiche per l'architettura Hy4 e il supporto STQ1_0, poiché non è compatibile con la versione stock di llama.cpp.

Qual è la differenza tra i parametri totali e quelli attivi in Hy4?

Hy4 usa un'architettura MoE (Mixture of Experts). Ha 770 miliardi di parametri totali, ma per ogni singolo token generato ne attiva solo 49 miliardi, ottimizzando così il calcolo.

In quali settori business è più efficace Hy4 rispetto a modelli generalisti?

Eccelle nel software engineering a lungo termine, nello sviluppo di prototipi per game engine, nell'analisi di documenti finanziari complessi e nella ricerca scientifica (fisica della materia condensata e matematica pura).


Fonti: Startupfortune, Lookonchain, Testingcatalog ·

glacom · Intelligenza artificiale per aziende: i modelli girano sui tuoi server, i dati non escono →
Hai una domanda su questo dossier?

Scrivila qui: Susanna, l assistente AI di glacom, ti risponde via email con un approfondimento gratuito.

Nessuna consulenza personalizzata (finanziaria, legale o medica): solo informazione e fonti. Email usata solo per rispondere.

oppure scrivile su: WhatsApp · Telegram · SimpleX · Delta Chat · Email

Condividi su Facebook Condividi su Twitter Condividi su Pinterest Condividi su Telegram Condividi su WhatsApp
Visualizza per la stampa
CLOSE X
Condividi questa notizia
Vedi anche
Recupero Ranking Google: i rischi del Disavow e i tempi di attesa
Analisi tecnica sul recupero della visibilità organica dopo i cali di traffico. Il rischio del link disavow e i tempi di ripresa post-August Core Upda…
18/09/2026 09:25
F/ai e la corsa all'AI: l'alleanza tra giganti a Parigi per le startup
OpenAI, Google e Meta collaborano nell'acceleratore F/ai a Station F, mentre Meta slitta il lancio di Avocado. Analisi su strategia, modelli e sovrani…
18/09/2026 07:54
IA nella Giustizia: la Fiscalía spagnola automatizza bozze penali
La Fiscalía General del Estado di Spagna introduce l'IA per redigere atti di accusa per reati stradali. Analisi su efficienza, limiti legali e impatto…
18/09/2026 05:55
EU KIDS Act: no ai social autonomi sotto i 15 anni e limite di 60 minuti
L'UE adotta l'EU KIDS Act: divieto social sotto i 13 anni, account limitati fino ai 15 e onere della prova sulle piattaforme. Analisi per imprenditori…
18/09/2026 05:55
Commissione Europea: EU KIDS Act blocca i social sotto i 13 anni
L'UE introduce l'EU KIDS Act: accesso ai social dai 15 anni, mini account dai 13 e limiti a chatbot e gaming. Analisi delle implicazioni per il mercat…
18/09/2026 05:55


Iscriviti alle newsletter

Iscriviti alle newsletter di glacom o modifica le tue preferenze

ISCRIVITI ORA