AMDs åpne AI-satsing tar et nytt steg med Instella-MoE

AMDs åpne AI-satsing tar et nytt steg med Instella-MoE

AMD har lenge villet bevise at Nvidias CUDA-dominans ikke er evigvarende. Nyeste bevis: Instella-MoE-16B-A3B, en fersk mixture-of-experts-modell trent fra bunnen av på selskapets egne Instinct-kort.

Fra 3B til MoE

Instella-familien startet i mars 2025, da AMD slapp en serie 3-milliarder-parameter språkmodeller trent fra bunnen av på 128 Instinct MI300X-GPUer. Modellene var fullt åpne – vekter, treningsdata, hyperparametre og kode – og målte seg mot Llama 3.2 3B, Gemma-2 2B og Qwen 2.5 3B. Siden den gang har AMD bygget videre med varianter som Instella-Long (128K kontekstvindu) og Instella-Math for resonnering.

Nyeste tilskudd er Instella-MoE-16B-A3B. Modellen har 16 milliarder parametere totalt, men aktiverer bare 2,8 milliarder per token takket være mixture-of-experts-arkitektur. Den er trent på både MI300X- og MI325X-GPUer, og bruker teknikker som gated multi-head latent attention for å holde ressursbruken nede.

Ikke helt fri fri

Her er det viktig å være presis: MoE-modellen slippes under en ResearchRAIL-lisens, som begrenser bruken til forskning og akademiske formål – ikke fri kommersiell bruk. Selve treningskoden er derimot MIT-lisensiert, så den delen kan gjenbrukes friere. AMD publiserer også vekter fra hvert trinn i treningen, sammen med datablandinger og konfigurasjoner.

Hvorfor det betyr noe

Poenget for AMD er ikke nødvendigvis å bygge den beste modellen i verden, men å bevise at Instinct-maskinvare og ROCm-stacken duger til storskala AI-trening – uten å være avhengig av Nvidias CUDA-økosystem. For alle som skrur med lokal AI og følger med på alternativer til Nvidia, er dette et signal om at AMD mener alvor med den langsiktige satsingen, ikke bare enkeltstående PR-stunt.

Ressurser

Read more