Real-world Gemma 4-testing: Hvordan står AI seg i praksis?
Gemma 4 er et stort skritt for åpne lokale modeller, men praktisk testing avslører at økosystemet rundt fortsatt er ungt. Resultatene varierer mer enn benchmarks alene tilsier.
Testoppsett
- Maskinvare: M4 Pro MacBook med 24GB RAM
- Modeller: Gemma 4 i ulike størrelser – trolig E2B/E4B i den mindre enden og 31B (dense) i storformat, som ved vanlig 4-bits kvantisering lander rundt 18GB
- Verktøy: OpenCode, Pi coding agent, OpenClaw
Konkrete observasjoner
- OpenCode – viste ustabilitet under testing
- Pi coding agent – pålitelig og produserte et fungerende tic-tac-toe-spill
- Mindre Gemma 4-modeller – integrerer godt med OpenClaw
- 31B-versjonen (~18GB) – fungerer, men trenger mer RAM for stabil ytelse enn en 24GB-maskin komfortabelt gir
- Innebygde funksjoner – websøk og bildeanalyse fungerer som forventet
Hva som er bra og dårlig
Bra:
- Reell kostnadsbesparelse for lokale arbeidsflyter
- Integrerte verktøy (websøk, bildeanalyse) virker pålitelig
- Mindre modeller passer godt til daglig kodearbeid
Dårlig:
- Verktøystabiliteten varierer mellom integrasjoner
- Den største modellen krever mer RAM enn mange laptoper har
- Tidlig økosystem betyr at du må feilsøke selv
Anbefaling
For utviklere som vil teste lokale AI: start med mindre modeller på pålitelige verktøy som Pi coding agent. Større modeller og mer eksperimentelle verktøy kan vente til de modnes.
Oppsummering
Gemma 4 leverer det den lover som modell, men økosystemet er fortsatt i tidlig fase. Forskjellen mellom benchmarks og praksis ligger ofte i verktøyene rundt – ikke i selve modellen. Merk at dette er én persons hands-on-test, ikke et kontrollert benchmark – ta konklusjonene som en pekepinn, ikke en fasit.