VoiceMem: To hjerner, ett minne for stemme-AI

VoiceMem: To hjerner, ett minne for stemme-AI

VoiceMem er et åpen kildekode-rammeverk for å gi stemmedrevne AI-assistenter et minne som faktisk husker hvem du er, ikke bare hva du sa sist. Prosjektet er publisert som en vitenskapelig artikkel og et Python-bibliotek – "pip install voicemem" – ment for utviklere som bygger egne stemme-agenter, digitale mennesker eller smart maskinvare, snarere enn en ferdig app du laster ned og snakker med direkte.

Venstre hjerne, høyre hjerne

Konseptet er faktisk beskrevet nøyaktig slik på prosjektets egen side: en "venstre hjerne" håndterer fakta – entiteter, personer og kunnskap organisert i skjemaer – mens en "høyre hjerne" modellerer følelser, preferanser og personlighet. Hele pipelinen er strømmende: mens du fortsatt snakker, blir lyden segmentert, transkribert og skrevet inn i minnegrafen i sanntid. Når systemet trenger å hente frem noe, ruter det først, rangerer deretter, og injiserer bare de mest relevante minnene inn i konteksten.

Tallene er reelle og oppsiktsvekkende

På LoCoMo-benchmarken for langtids faktaminne scorer VoiceMem 91,2 prosent nøyaktighet – best av alle sammenlignet med konkurrenter som EverMemOS (83,1 %), Zep (62,9 %) og Mem0 (61,7 %). Samtidig bruker den bare rundt 430 token med minnekontekst per henting, mot 6 956 for Mem0 – og svarer på 134 millisekunder, mot 1 440 millisekunder for Mem0 og hele 17 sekunder hvis man i stedet skulle mate hele samtalehistorikken inn på nytt hver gang. Det er denne kombinasjonen – høy nøyaktighet, lavt tokenforbruk og minimal forsinkelse – som er selve poenget: minnet skal ikke bremse en sanntids stemmesamtale.

Bygget på eksisterende talemodeller

VoiceMem er ikke en egen språkmodell, men et lag som trenes inn i eksisterende talemodeller som Qwen2.5-Omni, Qwen3-Omni og Step-Audio2-Mini, gjennom en teknikk forskerne kaller "on-policy distillation". Treningsdataene (ChatMem-400K) er bygget gjennom en trestegs prosess med simulerte minneverdener og menneskelig kvalitetssikring.

Hva du faktisk trenger for å prøve det

Vil du bare teste konseptet, finnes det en interaktiv webdemo du kan sette opp lokalt med noen kommandolinjer. Vil du bygge det inn i et eget produkt, er selve biblioteket designet for å legges til med noen få linjer Python-kode i en eksisterende stemme-pipeline.

Ressurser

Read more