De meeste AI-beslissingen in een bedrijf hebben geen tekst nodig. Ze hebben een ja of een nee nodig.
Moet deze mail naar de klantenservice of naar de administratie? Is deze aanmelding echt, of een bot? Is deze aanvraag het opvolgen waard? Dat soort vragen stel je nu vaak aan een groot taalmodel als ChatGPT of Claude, dat vervolgens een hele alinea bedenkt om uiteindelijk "administratie" te zeggen. Dat werkt, maar het is traag en duur als je het duizend keer per dag doet.

Op 15 september bracht TypeSafe AI een model uit dat precies dat andere deel van het werk doet: Jev. Ik heb me er de afgelopen tijd in verdiept, de documentatie gelezen, ermee gebouwd en gekeken wat ontwikkelaars er in hun eigen projecten mee doen. Dit is wat ik ervan geleerd heb.
Een model dat niet praat
Jev schrijft geen tekst. Je geeft het een stuk tekst of gegevens, samen met een vraag waarvan de mogelijke antwoorden vastliggen. Terug krijg je hoe waarschijnlijk elk antwoord is. Er zijn drie soorten vragen: kies één optie uit een lijst, plaats iets op een schaal die je zelf omschrijft, of zeg hoe waarschijnlijk het is dat iets klopt.

Omdat Jev geen zinnen hoeft te bedenken, is het snel en goedkoop. Een vraag is meestal binnen een tiende tot een halve seconde beantwoord. Je betaalt 4,2 dollarcent per miljoen tokens die je instuurt, en de antwoorden zelf zijn gratis. Het bedrijf noemt het in de documentatie een model om software mee te bouwen, geen agent: het kiest nooit zelf wat de volgende stap is.
Een slimme regel in je software
De beste uitleg die ik tegenkwam: zie Jev als een als-dan-regel in je software, maar dan een die tekst begrijpt. Je roept het aan op de plek waar je code een oordeel nodig heeft, en je code doet daarna iets met het antwoord. Een ontwikkelaar liet dat zien door ruim 32.000 berichten uit zijn eigen AI-chats te laten indelen, met een schuifje om de drempel te kiezen: hoe zeker moet Jev zijn voordat een bericht in een bak mag.
Daar hoort een handige vuistregel bij. Als een mens langer dan een seconde of tien moet nadenken over de beslissing, is Jev het verkeerde gereedschap. Het is gemaakt voor de snelle, bijna automatische beslissingen die je zelf ook zonder na te denken zou nemen, alleen dan duizend keer achter elkaar.
Jev beantwoordt een vraag. Jouw software beslist wat er daarna gebeurt.
Wat ontwikkelaars er nu mee bouwen
In de anderhalve week na de lancering verschenen er tientallen voorbeelden. De bruikbaarste hebben één ding gemeen: Jev doet het sorteerwerk, en de rest van het systeem blijft zoals het was.
Eerst sorteren, dan pas het dure model. In een vergelijking met duizend e-mails die langs zeven regels werden beoordeeld, deed Jev dat in 70 seconden voor 9 dollarcent. Een van de goedkopere gewone taalmodellen deed er vijf minuten en 62 dollarcent over. De les daaruit: laat Jev de stapel sorteren, en zet een groot taalmodel alleen in op wat overblijft, voor het schrijven van een antwoord of een analyse.

Aanvragen beoordelen. Jev kan een lijst van 250 potentiële klanten op twee kenmerken beoordelen, in vier seconden en voor een cent. Daarna hoeft een taalmodel als Claude alleen nog verder met de kansrijke klanten, bijvoorbeeld om ze uit te zoeken of een eerste bericht op te stellen.
Nepaanmeldingen tegenhouden. Een softwareteam laat elke nieuwe aanmelding op zijn platform door Jev beoordelen, elk kwartier tot half uur. Samen met een dienst die de aanmelders natrekt, kost dat ongeveer een dollar per dag. Boven een bepaalde zekerheid wordt een account automatisch geblokkeerd. Hetzelfde idee werkt met drie zones, bijvoorbeeld tegen berichten die een AI proberen te misleiden: boven de 70 procent blokkeren, tussen 35 en 70 procent naar een mens, daaronder doorlaten.

Controle voordat een AI-agent iets doet. In een demo staat Jev tussen een AI-agent en zijn acties. Voordat de agent iets uitvoert, beantwoordt Jev vier vragen: past deze actie bij wat er gevraagd werd, ontbreekt er informatie, komen de gegevens uit het gesprek, en is het niet te vroeg? Een paar gewone regels code beslissen daarna of de actie doorgaat of dat de agent eerst moet terugvragen.
Het juiste model per taak. Jev kan per taak kiezen welk model het werk krijgt: het kleinste voor eenvoudige klussen, het grootste voor het echte denkwerk. Jev kost daarbij bijna niets, en elke taak die niet naar het dure model gaat, scheelt geld.
Betere antwoorden uit je eigen documenten. Een chatbot die antwoorden zoekt in je eigen documenten, staat of valt met de passages die hij vindt. Laat je Jev die passages beoordelen op relevantie, met criteria die je zelf in gewone taal opschrijft, dan komt het juiste stuk veel vaker bovenaan. In die test ging dat van 21 naar 54 procent van de gevallen.
Waar het niet past
Er zijn ook genoeg voorbeelden van hoe het niet moet. In een live-uitzending liet een ontwikkelaar Jev elke zet in een kaartspel kiezen, en kreeg het niet werkend: het spel vraagt erom dat je vooruit plant, en dat kan Jev niet. Een ander liet Jev elke minuut kiezen tussen bitcoin kopen, houden of verkopen, en dat ging slecht. Logisch, want het goede antwoord staat niet in de gegevens. Het patroon: zodra Jev vooruit moet plannen, of het antwoord niet in de gegevens staat, gaat het mis. Een losse keuze per stap kan wel, zolang je eigen software de regie houdt.
Verder zijn er drie dingen om op te letten. De cijfers van bijna 200 keer sneller en ruim 400 keer goedkoper komen uit de eigen tests van TypeSafe, en het bedrijf zegt er zelf bij dat dat de bovenkant is van wat je in de praktijk haalt. Wie het zelf nameet, komt meestal uit op een paar keer tot ruim tien keer sneller dan de goedkoopste gewone taalmodellen. Nog steeds veel, maar reken je niet rijk.
Jev werkt ook het best in het Engels. Andere talen kan het aan, maar minder goed, dus test het eerst op je eigen Nederlandse teksten.
En Jev draait bij een Amerikaans bedrijf. TypeSafe belooft dat het niet traint op wat je instuurt, maar hoe lang je gegevens bewaard blijven, staat niet scherp omschreven. Alleen grote zakelijke klanten kunnen afspreken dat er niets bewaard wordt. Stuur er dus geen namen, klantgegevens of gevoelige informatie heen zonder dat eerst uit te zoeken.
Vier vragen voordat je begint
Uit alles wat ik zag, komen vier voorwaarden. Jev loont pas als ze alle vier gelden.
Doe je dit honderden keren? De winst zit in volume. Bij vijf beslissingen per dag ben je zelf sneller.
Staat het antwoord in wat je instuurt? Een deskundige moet het in een paar seconden kunnen beslissen op basis van wat er staat. Hangt het af van kennis die alleen in jouw hoofd zit, dan gaat het mis.
Houdt je software de regie? Jev beantwoordt de vraag, je eigen systeem bepaalt wat er daarna gebeurt.
Kost een fout weinig? Sorteren, filteren en doorsturen, met twijfelgevallen naar een mens. Niet voor betalingen of definitieve besluiten.
Wie wil beginnen, kiest één beslissing die vaak voorkomt en waarvan achteraf duidelijk is wat het goede antwoord was. Leg vijftig voorbeelden vast met het juiste antwoord, stel de vraag zo concreet mogelijk, en kijk vooral hoe vaak Jev gelijk heeft op de momenten dat het zegt zeker te zijn. Dat vertelt je meer dan elke video.
De vraag die je jezelf mag stellen
Jev kan veel minder dan ChatGPT of Claude. Juist daardoor past het op plekken waar een groot taalmodel te traag of te duur is, en waar nu een paar ruwe regels of een mens de stapel doorwerkt.
Dus welke beslissing neem jij, of je team, honderd keer per dag op dezelfde manier? Daar zit het werk dat een model als Jev kan overnemen, terwijl jij je tijd besteedt aan de beslissingen waar echt over nagedacht moet worden.
Benieuwd wat AI voor jouw bedrijf kan betekenen?
Doe de gratis AI Scan en ontdek het in 1 minuut.
