Hold AI-minnet i sjakk med komprimeringskonfigurasjonen

Hold AI-minnet i sjakk med komprimeringskonfigurasjonen

Hermes lar deg justere når og hvor aggressivt agentene komprimerer minnet sitt. Standardterskelen er allerede satt til 0,5 – altså 50 % av kontekstvinduet – nettopp for å unngå de store kontekstkollapsene som ofte skjer rett før minnegrensene treffes.

Hvordan Hermes faktisk komprimerer

Hermes bruker et system i to lag: agentens egen komprimering utløses ved 50 % av kontekstvinduet (standard), mens et sikkerhetsnett på gateway-nivå utløses ved 85 % dersom noe går galt før det.

Selve komprimeringen er ikke bare "slett gammelt, behold nytt". Algoritmen jobber slik: først fjernes gamle verktøyresultater billig og uten et eget LLM-kall. Deretter beskyttes "hodet" av samtalen (systemprompt og første utveksling) og en "hale" på om lag 20 000 tokens med nyere kontekst. Alt i midten oppsummeres gjennom et eget LLM-kall, som til og med kan pekes mot en annen modell eller leverandør enn resten av samtalen.

Konfigurasjonen bak terskelen

Terskelen er justerbar via noen få innstillinger:

  • threshold – hvor stor andel av kontekstvinduet som må fylles før komprimering starter (standard 0,5)
  • target_ratio – hvor mye av terskelen som beholdes som hale etter komprimering (standard 0,2)
  • protect_last_n – minimum antall nyere meldinger som alltid beskyttes (standard 20)
  • protect_first_n – antall innledende meldinger som forblir urørt gjennom hele økten

Senker du threshold under standarden, kjører systemet komprimering enda oftere, i enda mindre porsjoner. Hever du den, nærmer du deg den sjeldne-men-store komprimeringsstilen andre agentsystemer ofte bruker som standard.

Hva du faktisk vinner

  • Bevart kontekstforståelse – fordi hode og hale beskyttes eksplisitt, mister ikke agenten systemprompten eller den ferskeste samtalen selv etter mange komprimeringsrunder
  • Færre dramatiske tap – oppsummeringen skjer gradvis på midtseksjonen, ikke som en brå "nødrydding" rett før grensen
  • Stabil ytelse over tid – viktig for langvarige Hermes-arbeidsflyter

Begrensninger

Minnehåndtering er fortsatt et område der Hermes har forbedringspotensial. Hyppigere komprimering betyr flere separate LLM-kall til oppsummeringsmodellen, som har sin egen kostnad i tokens og responstid – ikke primært CPU-tid. Terskelen bør derfor tilpasses arbeidsflyten din: kortere, billigere oppgaver tåler en lavere terskel bedre enn lange, dyre kjøringer.

Oppsummering

Standardterskelen på 0,5 er et godt utgangspunkt for de fleste oppgaver – det er nettopp derfor den er standard. Eksperimenter med threshold, target_ratio og protect_last_n for å finne balansen som passer ditt bruk.

Ressurser

Read more