Tencent Hy4: kuidas 770 miljardi parametri mudel mahub laptopi

- Tencent avaldas avatud lähtekoodiga Hy4 preview mudeli 770 miljardi parametriga.
- AngelSlim tehnoloogia vähendas mudeli suurust 1,5 TB-st 214 GB-ni (86% langus).
- Mudel on suunatud keerukale tarkvaratehnikaale, mängude arendamisele ja teadustööle.
- Optimeeritud versioon võimaldab kasutada mudelit kohalikus riistvaras, sealhulgas RTX 4090 laptopides.
Tehisintellekti maailmas on seni valitsnud dogma, mille kohaselt tipptasemel toimivad mudelid nõuavad massiivset serveriparki ja tohutut VRAM-i mahtsust. Tencent on aga murdnud selle eelseetse. Hiina tehnigigant on avaldanud Hy4 preview mudeli, mis ei ole mitte ainult tohutu oma mahult, vaid tänu uuendatud kompressioonimeetoditele ka üllatavalt paindlik lähenemisviisilt.
Massiivne arhitektuur ja avatud ligipääs
Hy4 preview on konstruktsioonilt MoE (Mixture of Experts) mudel, millel on kokku 770 miljardit parametrit. Iga tokeni töötlemiseks on aktiivne 49 miljardit parametrit, mis võimaldab mudelil säilitada kõrget tõhusust, ilma et peaks iga kord kogu massiivset võrgustikku käivitama. Üks kõige silmapaistvamaid omadusi on kontekstakna suurus, mis ületab ühe miljoni tokeni, pakkudes võimalust analüüsida terviklikke koodibasse või mahukaid dokumentide kogumeid.
Tencent on mudeli avaldanud Apache 2.0 litsentsiga, mis on ettevõtjatele ja arendajatele kriitiline detail. See tähendab, et mudel on kättesaadavavalt mitte ainult Tencent Cloudi ja OpenRouteri kaudu, vaid ka avalikest hoidlatest, võimaldades ettevõtetel seda oma vajadustele kohandada ilma range piiranguteta.
AngelSlim ja Sherry: kompressiooni uus tase
Kõige suurem tehniline läbimurre peitub aga AngelSlimi meeskonna töös. Algselt nõudis Hy4 mudeli BF16 kaalude hoidmiseks ligi 1,5 terabaiti mälu, mis on praktiliselt kättesaamatu tavalise ettevõtte või väikse labori jaoks. Kasutades uut 1,25-bitise kvantiseerimise meetodit nimega Sherry, õidnesti Tencent mudeli suuruse 214 gigabaidini.
See ei olnud lihtne ühtlane kompressioon. Toimimus oli nutikas: mitte-kriitilised kihid pressiti kuni 1,31-bitini, samas kui tundlikumad kihid säilitasid 2-bitise või kõrgema täpsuse. Tulemuseks oli keskmine täpsus umbes 2,38 bitti ühe kaalu kohta (bpw). See strateegia võimaldas vähendada mudeli suurust 86%, kuid hoida jõitluslangus minimaalsena. Näiteks SWE-bench Pro testimisel oli jõitluslangus vaid 0,7%.
Riistvara piiride nihutamine
Kuigi pealkirjad võivad vihjata, et iga gaming-laptop on nüüd superkompüter, on reaalsus nüanssidega. Hy4-i kvantiseeritud versioon nõuab täieliku residentse töö jaoks ikka umbes 214 GiB VRAM-i. See tähendab, et üks RTX 4090 laptop ei suuda mudelit täielikult mäluplaastile tõsta, kuid see muudab mudeli liigutamise ja kasutamise väiksemates laborites reaalseks.
Tencent testis ka heterogeenseid seadmeid, kasutades prima.cpp raamistikku. Kombineerides RTX 4090 laptopi ja 4-A4000 serveri (kokku 80 GB VRAM ja 64 GB RAM), saavutati kiirus 1,02 tokenit sekundis. See on kuus korda kiirem kui mudeli käivitamine vaid laptopis, kasutades mäluladumist (offloading). See tõestab, et tipptasemel AI-mudelite töökoormust saab nüüd jagada erinevate, odavamate seadmete vahel.
Tarkvaratehnika ja teaduslik potentsiaal
Hy4 ei ole lihtsalt järjekordne chatbot, vaid tööriist, mis on treenitud spetsiaalselt tarkvarainsenerite, mängude arendajate ja finantsanalüütikute kogemustel. Mudel on suutnud demonstreerida võimekust, mis ületab mitmeid konkurente keerukates ülesannetes:
Hy4 preview suudab hallata mitmeid Codexi sessioone paralleelselt, muuta oma uurimissuunda vastavalt saadud tulemustele ja koordineerida tööd mitme evaluatsioonitargeti vahel, võites sõltumatult kaheksa erinevat benchmarki.
Mudel on suutel luua mängitavaid prototüüpe ühe prompti põhjal ja arendada neid edasi mängumootorites. Lisaks on see tõestanud oma väärtust kondenseeritud aine füüsikas ja puhas matemaatikas, mis viitab sellele, et mudel suudab tegeleda sügavate loogiliste ja struktuurnete probleemidega.
Kulu struktuur ja kasutusmudelid
Ettevõtjatele, kes ei soovi mudelit kohalikult käivitada, on Tencent pakkunud konkurentsivõimelist API hinnastust. See võimaldab ettevõtetel testida Hy4 võimekusi ilma suurest esialgsesest investeerimisest riistvarasse. Hinnastruktuur on järgmine:
Caching input: 0,042 USD miljoni tokeni kohta; Input: 0,834 USD miljoni tokeni kohta; Output: 2,501 USD miljoni tokeni kohta.
Hoolimata võimsusest märkib Tencent, et tegemist on preview versiooniga. Mudel võib mõnikord liiga kaua mõelda keerukate ülesannete üle või liigselt kontrollida oma vastuseid, mis on tüpiline varajase etapi reasoning-mudelitele.
Mida see tähendab Balti riikide ettevõtjatele?
Eestis ja Baltikumis, kus e-riigi infrastruktuur ja digitaalne ökosüsteem on juba kõrgel tasemel, avab Hy4-i sarnased avatud mudelid uusi võimalusi. Kuna meil puudub massiivne riistvaraliste ressursside baas, nagu USA-l või Hiinal, on just kvantiseerimine ja mudelite mahutamine väiksematesse seadmetesse kriitiline.
Eesti startupide jaoks tähendab see, et keerukate AI-lahenduste, näiteks autonoomsete tarkvaratehnika agentide või spetsiifiliste finantsanalüüsi tööriistade loomine ei nõua enam miljoneid dollareid GPU-klastritele. Kohalikud arendajad saavad kasutada kvantiseeritud GGUF versioone, et luua privaatsust säitvaid, kohalikult töötavaid rakendusi, mis ei saada andmeid pilve.
Samas tuleb arvestada Euroopa Liidu AI Actiga. Kuna Hy4 on tohutu mudel, võib selle kohalik kasutus ja fine-tuning nõuda rangemat riskianalüüsi, eriti kui seda rakendatakse kriitilistes teenustes. Kuid e-Estonia vaimus, kus efektiivsus ja digitaliseerimine on prioriteetsed, pakub Hy4-i sarnane tehnoloogia võimalust demokratiseerida tipptasemel AI-võimekused, muutes need kättesaadavaks ka väiksematele Balti ettevõtetele, kellel on vaid võimas tööstation ja ambitsioonid.
Korduma kippuvad küsimused
Kas Hy4 mudel töötab tavalisel laptopil?
Mudel mahub kvantiseerituna (214 GB) mäluladumise abil laptopile, kuid täielik ja kiire toimimine nõuab siiski märkimisväärset VRAM-i mahtsust või seadmete koostööd.
Mis on AngelSlim ja Sherry?
AngelSlim on Tencenti mudelite kompressiooni tööriistkott ja Sherry on konkreetne 1,25-bitise kvantiseerimise meetod, mis vähendas mudeli suurust 1,5 TB-st 214 GB-ni.
Milliste alaliste tööde jaoks on Hy4 kõige sobivam?
Mudel on optimeeritud pikaajalisteks tarkvaratehnika projektiideks, mängude arendamiseks, teadusuurimiseks (füüsika, matemaatika) ja mahukaks dokumendianalüüsiks.
Kas mudel on tasuta kättesaadav?
Mudel on avaldatud Apache 2.0 litsentsiga, mis võimaldab avatud kasutust, kuid API-põhine ligipääs Tencent Cloudi kaudu on tasuline.
Allikad: Startupfortune, Lookonchain, Testingcatalog ·
Scrivila qui: Susanna, l assistente AI di glacom, ti risponde via email con un approfondimento gratuito.
Nessuna consulenza personalizzata (finanziaria, legale o medica): solo informazione e fonti. Email usata solo per rispondere.
oppure scrivile su: WhatsApp · Telegram · SimpleX · Delta Chat · Email