Overslaan naar inhoud

Hoe bouwen we Thor 1.0?

Wat we ontwikkelen, met welke methode, en waaraan we het resultaat afmeten. Met uitleg van de termen.

Laatst nagekeken: 4 september 2026


Thor 1.0 is een AI-assistent die op de eigen infrastructuur van de klant draait en rechtstreeks werkt op zijn ERP-gegevens, zonder dat die gegevens een niet-Europese cloud passeren. De ontwikkeling start op 1 november 2026 en loopt zes maanden.

Dit is geen productpagina. Thor bestaat nog niet. Wat hieronder staat is het traject, de methode en de meetlat die we vooraf hebben vastgelegd.


Open of gesloten: de keuze waarop alles rust

Thor bouwt op Mistral Small 3, een model van het Franse Mistral AI. Die keuze is geen voorkeur maar een voorwaarde.

Een gesloten model bestaat alleen op de servers van de aanbieder. U kunt het niet downloaden en niet zelf draaien, dus uw gegevens moeten ernaartoe. Een open-weight model publiceert zijn gewichten: de getallen die het model tijdens zijn training heeft geleerd en die bepalen hoe het antwoordt. Die kunt u downloaden en op eigen apparatuur draaien, zonder enige verbinding met de aanbieder.

Thor draait op afgezonderde apparatuur in een Belgisch datacenter, afgeschermd van het internet. Dat veronderstelt dat het model daar fysiek kan staan. Bij een gesloten model is dat per definitie onmogelijk, hoe het contract ook luidt.

De licentie is de tweede voorwaarde. Mistral Small 3 staat onder Apache 2.0, die commercieel gebruik, aanpassing en herdistributie toelaat zonder omzetdrempel. Niet elk model dat "open" heet gaat zo ver, en open weights is bovendien niet hetzelfde als open source: de gewichten zijn publiek, de trainingsdata niet.

Uitgebreider: "Wat betekent 'open' bij een AI-model?"

De prijs van deze keuze staat in deel 8: een open model van deze omvang presteert op algemene taken minder goed dan de grootste gesloten modellen. Dat is de afweging die we bewust maken.


Wat "afstemmen op regelgeving" betekent

Hier zit de kern van wat we onderzoeken, en het is het lastigste om uit te leggen.

De gangbare aanpak vandaag is een filter rond het model. Het model geeft een antwoord, en daarna controleert een aparte laag of dat antwoord door de beugel kan. Werkt dat niet, dan wordt het antwoord tegengehouden. Het model zelf verandert niet.

Wij onderzoeken of het ook anders kan: door het model zo af te stemmen dat het van bij het begin binnen de grenzen van de regelgeving redeneert, in plaats van achteraf gecorrigeerd te worden.

De methode heet Group Relative Policy Optimization, afgekort GRPO. In gewone taal: het model krijgt dezelfde vraag meerdere keren voorgelegd, produceert daarop verschillende antwoorden, en die antwoorden worden onderling vergeleken en gerangschikt. Het model wordt vervolgens bijgestuurd in de richting van de best beoordeelde antwoorden. Het leert dus niet uit één voorbeeldantwoord, maar uit de vergelijking binnen een groep eigen pogingen.

De moeilijkheid zit niet in de techniek maar in het beoordelingscriterium. Om een antwoord te kunnen rangschikken, moet je juridische normen omzetten in een signaal waarop een model kan bijsturen. Dat is wat we in dit project moeten uitvinden en meten. GRPO wordt vandaag vooral toegepast in academische en redeneercontexten. Voor zover wij konden nagaan, is de methode nog niet ingezet om conformiteitsgedrag op bedrijfsgegevens af te stemmen.

Of dat werkt, weten we niet. Daarom is het een onderzoeksproject en geen product.


De opstelling

  • Dedicated hardware: Thor draait op afgezonderde apparatuur in een Belgisch datacenter, niet op gedeelde infrastructuur.

  • Afgeschermd van het internet: De omgeving heeft geen open verbinding naar buiten. Dat maakt het bouwen lastiger: elke koppeling moet uitdrukkelijk worden ingericht.

  • Een bidirectionele koppeling met SAP S/4HANA: S/4HANA is de huidige generatie van het ERP-pakket van SAP. Bidirectioneel betekent dat de koppeling in twee richtingen werkt: Thor leest gegevens uit het systeem én schrijft er zijn bevindingen naar terug.

  • Gecontaineriseerde clusters: Een container is een afgesloten pakketje waarin een programma draait met alles wat het nodig heeft. Zo draait elk onderdeel van Thor in een eigen afgebakende ruimte, wat het beheersbaar en herhaalbaar maakt.

  • Een onafhankelijke doorlichting: In maand vijf voert een externe beveiligingsexpert een penetratietest uit: een gecontroleerde poging om binnen te dringen, om zwakke plekken bloot te leggen voor iemand anders dat doet. Die persoon staat bewust buiten het project, want een doorlichting door onszelf heeft geen bewijswaarde.

  • Een DPIA-traject: Een gegevensbeschermingseffectbeoordeling brengt in kaart welke persoonsgegevens worden verwerkt en welke risico's daaraan verbonden zijn.


Hoe we het resultaat afmeten

Voor de eerste afstemmingsronde start, leggen we twee dingen vast: een nulmeting en twee drempels.

De nulmeting is de prestatie van het onafgestemde model op dezelfde testset. Zonder dat vertrekpunt kan je achteraf niet zeggen of iets verbeterd is.

De drempels: een foutmarge onder 8 procent op de testset, bij een terugval van maximaal 3 procentpunten op algemene benchmarks. Die tweede drempel is er omdat een model dat je scherper afstemt op één taak, doorgaans slechter wordt in andere. Een model dat perfect facturen controleert maar zijn algemene redeneervermogen verliest, is voor ons geen geslaagd resultaat.

Beide getallen liggen vast voor de eerste run. Dat is bewust: zo kan de uitkomst achteraf niet naar het gewenste resultaat worden geplooid.



Woordenlijst

  • Afgeschermde opstelling — een omgeving zonder open verbinding met het internet. Elke koppeling naar buiten moet uitdrukkelijk worden ingericht. 
  • Apache 2.0 — een permissieve licentie die gebruik, aanpassing en herdistributie toelaat, ook commercieel, zonder omzetdrempel. 
  • Benchmark — een gestandaardiseerde testreeks waarmee modellen onderling vergeleken worden op algemene taken. 
  • Bidirectionele koppeling — een verbinding die in twee richtingen werkt: lezen én terugschrijven. 
  • Connector — het stuk software dat twee systemen met elkaar laat praten, hier tussen Thor en het ERP-pakket. 
  • Container — een afgesloten pakketje waarin een programma draait met alles wat het nodig heeft. 
  • Dedicated hardware — apparatuur die uitsluitend voor één klant wordt gebruikt, in tegenstelling tot gedeelde infrastructuur. 
  • Drieweg-controle — de vergelijking van factuur, bestelbon en goederenontvangst. 
  • DPIA — gegevensbeschermingseffectbeoordeling: een analyse van de privacyrisico's van een verwerking, in bepaalde gevallen verplicht. 
  • ERP — het systeem waarin een onderneming haar bedrijfsprocessen beheert. SAP S/4HANA is daar een van. 
  • Foutmarge — het aandeel gevallen waarin het systeem een afwijking signaleert die er niet is, of er een mist die er wel is. 
  • Gesloten model — een model dat alleen bereikbaar is via de servers van de aanbieder en dat u niet kunt downloaden of zelf draaien. 
  • Gewichten — de getallen die een model tijdens zijn training heeft geleerd en die samen bepalen hoe het antwoordt. 
  • GRPO — Group Relative Policy Optimization: een afstemmingsmethode waarbij een model leert uit de onderlinge vergelijking van meerdere eigen antwoorden op dezelfde vraag. 
  • Hyperscaler — een zeer grote cloudaanbieder die capaciteit vrijwel onbeperkt kan bijschakelen. 
  • Nulmeting — de prestatie vóór aanpassing, als referentiepunt om verbetering aan af te meten. 
  • Open-weight model — een model waarvan de gewichten publiek beschikbaar zijn, zodat u het zelf kunt draaien. 
  • Open source — strikter dan open weights: ook de trainingsdata en het trainingsproces zijn dan beschikbaar. 
  • Peppol — het Europese netwerk voor de uitwisseling van gestructureerde elektronische facturen. 
  • Penetratietest — een gecontroleerde inbraakpoging om zwakke plekken op te sporen voor iemand anders dat doet. 
  • Responstijd — de tijd tussen de vraag en het antwoord van het systeem. 
  • Testset — een reeks gevallen die apart wordt gehouden om het model op te beoordelen, en die dus niet is gebruikt om het te trainen.



Thor 1.0 is in ontwikkeling. De ontwikkeling start op 1 november 2026 en loopt zes maanden. Dit artikel beschrijft een onderzoekstraject, geen bestaand product, en bevat geen toezegging over het resultaat.