MiniMax H3: Videomodellen som leser bilde, lyd og video som ett språk

MiniMax H3: Videomodellen som leser bilde, lyd og video som ett språk

juli slapp MiniMax sin nyeste videomodell, H3 (også kjent som Hailuo 3.0), og den prøver å løse noe de fleste videomodeller sliter med: å behandle tekst, bilder, video og lyd som separate, spesialiserte oppgaver i stedet for én sammenhengende kontekst.

Ett modell, mange referanser

I stedet for egne ekspertmodeller for redigering, subjekt-referanse og bevegelsesreferanse, er H3 trent til å behandle disse relasjonene som naturlig språk. MiniMax sitt eget eksempel illustrerer poenget: "Bruk kameraets bevegelse fra video 1, la karakteren i bilde 2 synge, med vokal som matcher lyd 3." Modellen kan ta imot flere bilder, videoklipp og lydfiler samtidig og veve dem sammen i én generering – det MiniMax kaller «omni-referanse».

Resultatet er video i opptil 2K oppløsning, 4–15 sekunder lengde med heltallsvarighet, og lyd generert i samme pass – dialog, effekter og ambience inkludert i stereo. Modellen støtter også instruksjonsbasert redigering, altså at du kan endre en karakter, et objekt eller lydsporet i et eksisterende klipp uten å generere hele scenen på nytt.

H3 er allerede tilgjengelig gjennom MiniMax sin API, i forbrukerappen Hailuo AI, og har dukket opp i tredjepartsverktøy som Krea samme lanseringsdag.

Åpne vekter – med en vri

MiniMax sa ved lansering at de planla å åpne modellvektene "i løpet av de kommende dagene". Vektene kom etter hvert, men med en egen MiniMax H3 Community-lisens datert 2. august – og her er det verdt å være obs: lisensen skal ifølge flere kilder utelukke kommersiell bruk i USA og EU. Så selv om modellen teknisk sett er åpen, er den ikke fritt spillbar for alle formål og alle brukere. Sjekk lisensvilkårene nøye før du bygger noe kommersielt rundt den.

Konkurransen er hard: H3 lanserte i samme vindu som ByteDances Seedance 2.5, og de to modellene sammenlignes allerede tett på ting som bildekonsistens, kamerabevegelse og pris per sekund.

Ressurser

Read more