Hold AI-minnet i sjakk med komprimeringskonfigurasjonen
Hermes lar deg justere når og hvor aggressivt agentene komprimerer minnet sitt. Standardterskelen er allerede satt til 0,5 – altså 50 % av kontekstvinduet – nettopp for å unngå de store kontekstkollapsene som ofte skjer rett før minnegrensene treffes.
Hvordan Hermes faktisk komprimerer
Hermes bruker et system i to lag: agentens egen komprimering utløses ved 50 % av kontekstvinduet (standard), mens et sikkerhetsnett på gateway-nivå utløses ved 85 % dersom noe går galt før det.
Selve komprimeringen er ikke bare "slett gammelt, behold nytt". Algoritmen jobber slik: først fjernes gamle verktøyresultater billig og uten et eget LLM-kall. Deretter beskyttes "hodet" av samtalen (systemprompt og første utveksling) og en "hale" på om lag 20 000 tokens med nyere kontekst. Alt i midten oppsummeres gjennom et eget LLM-kall, som til og med kan pekes mot en annen modell eller leverandør enn resten av samtalen.
Konfigurasjonen bak terskelen
Terskelen er justerbar via noen få innstillinger:
- threshold – hvor stor andel av kontekstvinduet som må fylles før komprimering starter (standard 0,5)
- target_ratio – hvor mye av terskelen som beholdes som hale etter komprimering (standard 0,2)
- protect_last_n – minimum antall nyere meldinger som alltid beskyttes (standard 20)
- protect_first_n – antall innledende meldinger som forblir urørt gjennom hele økten
Senker du threshold under standarden, kjører systemet komprimering enda oftere, i enda mindre porsjoner. Hever du den, nærmer du deg den sjeldne-men-store komprimeringsstilen andre agentsystemer ofte bruker som standard.
Hva du faktisk vinner
- Bevart kontekstforståelse – fordi hode og hale beskyttes eksplisitt, mister ikke agenten systemprompten eller den ferskeste samtalen selv etter mange komprimeringsrunder
- Færre dramatiske tap – oppsummeringen skjer gradvis på midtseksjonen, ikke som en brå "nødrydding" rett før grensen
- Stabil ytelse over tid – viktig for langvarige Hermes-arbeidsflyter
Begrensninger
Minnehåndtering er fortsatt et område der Hermes har forbedringspotensial. Hyppigere komprimering betyr flere separate LLM-kall til oppsummeringsmodellen, som har sin egen kostnad i tokens og responstid – ikke primært CPU-tid. Terskelen bør derfor tilpasses arbeidsflyten din: kortere, billigere oppgaver tåler en lavere terskel bedre enn lange, dyre kjøringer.
Oppsummering
Standardterskelen på 0,5 er et godt utgangspunkt for de fleste oppgaver – det er nettopp derfor den er standard. Eksperimenter med threshold, target_ratio og protect_last_n for å finne balansen som passer ditt bruk.
Ressurser
- Context Compression and Caching – Hermes Agent docs – offisiell dokumentasjon