
Vi byttet ut dommeren: hva skjer når en 70-millisekunders modell får avgjøre utleggene dine?
Av Mats Oustad • September 21, 2026
Vi har en agent som godkjenner ansatt-utlegg i Tripletex hver morgen. Det meste avgjøres av enkle regler: beløp under en bestemt terskel med godkjent kvittering går rett gjennom, beløp over et hardt tak går alltid til et menneske. Men det er en gråsone i midten, og der sitter en LLM som «dommer». Den får utlegget, OCR-teksten fra kvitteringen og en policy, og svarer godkjenn eller eskalér.
Dommeren måler vi mot et datasett med ekte, anonymiserte kvitteringer, så vi kan bytte modell og se hva som faktisk skjer med beslutningene. LLM-er gjør jobben godt, men de er verken gratis eller raske. Så da TypeSafe AI slapp Jev forrige uke, med løftet om svar på 70-500 millisekunder og en pris på 4 cent per million tokens, ville vi se hva som skjedde om vi satte den i dommerstolen.
Hva Jev egentlig er
Jev er ikke en chat-modell. Du sender inn en state (tekst eller JSON) og en liste med typede spørsmål, og får tilbake sannsynligheter. Et noul-spørsmål er et ja/nei-spørsmål som besvares med et tall mellom 0 og 1. Et choice-spørsmål gir en sannsynlighetsfordeling over alternativer du selv definerer. Ingen fritekst, ingen «her er min vurdering». TypeSafe hevder at tallene er kalibrerte: 0,9 skal bety at modellen har rett ni av ti ganger.
Det passer veldig godt til en dommer. En vanlig LLM-dommer svarer med et strukturert objekt, men tanken bak er fortsatt «les prompten, resonnér, svar». Jev tvinger deg til å stille konkrete spørsmål.
Slik måler vi
Eval-suiten vår scorer dommeren mot 73 ekte kvitteringer med fasit. Tre tall betyr noe:
- Accuracy - andel riktige beslutninger.
- FAR (False Approve Rate) - andel av utleggene som skulle eskaleres, men som ble auto-godkjent. Dette er pengerisikoen: feil kategori eller feil kvittering som blir betalt uten at noen ser på det.
- FER (False Escalate Rate) - andel av utleggene som skulle godkjennes, men som ble sendt til et menneske. Dette er støy for den som skal godkjenne, og det som får folk til å slutte å stole på agenten.
Som referanse kjørte vi to vanlige LLM-er med samme prompt og policy gjennom det samme datasettet. gpt-5.4-mini ligger på accuracy 0,78, FAR 0,28 og FER 0,17. gpt-5.6-luna er mer treffsikker (0,85) og langt mildere mot legitime utlegg (FER 0,06), men slipper flest tvilsomme gjennom (FAR 0,32). Begge er gode på innhold som ikke stemmer med tittelen; begge sliter med kategori-gråsonene, der de bare fanger rundt 6 av 13. Det er tallene Jev måtte slå.
Forsøk 1: Jev som direkte erstatning
Første versjon stilte fire generelle spørsmål: stemmer kvitteringen med tittelen, stemmer den med bokført kategori, er dette et legitimt utlegg ifølge policyen, og ser dette ut som et forsøk på prompt-injection. Godkjenn hvis alle er over en terskel.
Med terskel 0,7 eskalerte Jev nesten alt. Accuracy 0,37, FER 0,96. Vi dumpet sannsynlighetene per utlegg for å se hva som skjedde, og svaret var tydelig: policy-spørsmålet var nesten støy. Medianen for utlegg som skulle godkjennes lå på 0,46, for utlegg som skulle eskaleres på 0,34. Policyen vår er skrevet for mennesker («eskalér alt som virker uvanlig»), og Jev tar den bokstavelig.
Kategori-spørsmålet derimot skilte klassene fint: median 0,91 mot 0,56. Da vi lot kun kvitterings-spørsmålene bestemme, landet Jev på accuracy 0,82, FAR 0,20 og FER 0,17. Allerede på høyde med referansemodellene: over gpt-5.4-mini på accuracy, litt under gpt-5.6-luna, men med lavere FAR enn begge, til en tjuefemtedel av prisen og på 0,3 sekunder per utlegg.
Forsøk 2: hent fakta, bestem i kode
TypeSafe sin egen dokumentasjon sier det rett ut: hold logikken i kode, ikke i prompten. Så vi snudde det på hodet. I stedet for å spørre «passer dette i kategorien?» stiller vi tretten smale spørsmål om selve kjøpet i ett kall:
- Er dette mat eller drikke?
- Er det et sosialt arrangement for ansatte (julebord, sommerfest, teammiddag)?
- Er det møte-, kurs- eller kundekontekst?
- Er det programvare eller SaaS? Mobilabonnement? Elektronikk? Kontorrekvisita? Møbler? Porto? Litteratur?
- Er det et blandet krav der kvitteringen bare dekker en del?
- Pluss et
choice-spørsmål: hvilken type reise er dette, om noen?
Kategori-reglene ligger i Python. «Kontorrekvisita» støttes av kontorforbruk og motsies av elektronikk, programvare, mat og reise. «Møte, kurs» støttes av møtekontekst og motsies av sosialt ansatt-arrangement. «Fly» støttes bare av reisetype fly, ikke flytog. Passingen til kategorien blir min(beste støtte, 1 − verste motsigelse), og hele beslutningen er lesbar i tracen: «støtte is_meeting_or_course_context=0,97, motsigelse is_social_employee_event=0,29».
Det gjorde noe med feilbildet. Jev fanget nå alle 25 utleggene som skulle eskaleres, inkludert samtlige 13 kategori-feil (gpt-5.4-mini og gpt-5.6-luna tar rundt 6 hver). Feilene den gjør er utelukkende at den er litt for streng mot legitime utlegg med svak støtte, typisk «Telefon april» der mobilabonnement-sannsynligheten lander på 0,6.
Forsøk 3: kaskade
Når Jev er sikker, er den veldig sikker. Så hvorfor la den avgjøre alt? Vi la inn en grense der score over 0,8 godkjennes, under 0,5 eskaleres, og alt i mellom sendes til en LLM-dommer. Vi prøvde begge referansemodellene som mottaker. Jev koster nesten ingenting, så den kjører på hvert eneste utlegg først.
I praksis havnet ni utlegg i usikkerhetssonen. Alle ni var legitime utlegg Jev var usikker på, og da plukker LLM-en dem opp og godkjenner de fleste.
Resultatene
Alle tall er medianer over tre kjøringer på samme datasett.
De to LLM-ene har hver sin styrke. Luna er mildest mot legitime utlegg, 5.4-mini strengest mot tvilsomme, og ingen av dem klarer begge deler. Det gjør Jev.
Fem av de 73 utleggene stoppes av reglene før noen dommer ser dem. Av de 68 som når dommeren, sender kaskadekjøringene bare åtte-ni videre til LLM-en. Det gir 87 % færre LLM-tokens, og ikke ett tvilsomt utlegg slapp gjennom i noen av kjøringene. Med luna bak Jev ender bare to utlegg feil, begge som unødvendige eskaleringer. Latency for kaskadene gjelder LLM-leddet; resten avgjøres av Jev på 0,3 sekunder.
Hva vi tar med oss
Spør om fakta, ikke om dommer. Den største gevinsten kom ikke fra modellen, men fra å slutte å be den om en vurdering. «Er dette mat?» er et bedre spørsmål enn «er dette legitimt?». Reglene som avgjør blir dermed kode vi kan lese, teste og endre uten å røre en prompt.
Kalibrerte sannsynligheter er en ny knapp. Med en LLM får du ja eller nei. Med Jev får du et tall, og da kan du velge hvor streng du vil være per kategori, eller sende det usikre videre. Det er en helt annen type kontroll over pengerisiko.
Billig og raskt endrer arkitekturen. Når et kall koster fire hundretusendels dollar og tar 0,3 sekunder, er det ingen grunn til å ikke kjøre det på alt. Kaskaden er ikke et kompromiss, den er bedre enn begge delene alene.
Dette var et raskt eksperiment over en dag, ikke noe vi har satt i produksjon.
Men som første uke med en helt ny modellklasse? Vi er ganske begeistret.