Hoe het werkt · De toets
Een toets die je kunt verantwoorden
Toetsen komt binnenkort in GoYou. Hoe we het doen en waar we de grens leggen staat hier nu al, zodat je het aan je sectie, je examencommissie en je leerlingen kunt uitleggen.
Zo wordt een toets gemaakt.
Een toets is geen lijst vragen die een taalmodel ophoest. Het is een keten met een vaste volgorde, waarin elke stap iets controleert wat de vorige niet kon, en waarin de laatste stap altijd jij bent.
Stap 1
Alleen wat je klas heeft gehad
Een toets komt uit jouw lessen, een reeks, of tekst en leerdoelen die je zelf aanlevert. Elke vraag verwijst naar het stuk stof waar hij op berust. Een vraag zonder die verwijzing bestaat niet.
Stap 2
Eerst de opbouw, dan de vragen
Je ziet per leerdoel hoeveel vragen er komen, op welk denkniveau en voor hoeveel punten. Dat is de toetsmatrijs. Bij een toets die meetelt keur jij die goed vóór er één vraag geschreven wordt.
Stap 3
Aantallen rekent de code uit, niet de AI
Hoeveel vragen en punten een leerdoel krijgt volgt uit vaste regels: elk leerdoel komt aan bod en geen enkel leerdoel neemt meer dan veertig procent van de toets in.
Stap 4
Een norm die een regel kan zien, wordt in code afgedwongen
Geen “alle bovenstaande”, geen dubbele ontkenning, geen goed antwoord dat toevallig het langste is, een sleutel bij elke gesloten vraag, zinnen die passen bij het taalniveau van je klas. Wat afvalt gaat één keer terug naar de schrijver, met de reden erbij.
Stap 5
Een tweede lezer die niets mag weten
Een ander AI-model leest elke vraag zonder te zien welk denkniveau bedoeld was, en rekent de sleutel na. Zegt hij “dit is onthouden”, dan moet hij de zin uit de stof citeren waar het antwoord staat, en controleert de code dat citaat. Een vraag die onder zijn niveau zit wordt één keer herschreven.
Stap 6
Jij keurt, en niets gaat eerder naar leerlingen
Je ziet de vragen zoals je leerlingen ze zien, met per vraag de sleutel, het leerdoel, de stof en elk signaal dat wij niet zelf konden beslechten. Je past aan, gooit weg, voegt toe. Een collega laten meekijken kan op één afdrukbaar nakijkblad.
Twee soorten
Formatief of summatief is een andere vraag dan wel of geen score.
Een formatieve toets laat zien waar je klas staat en mag best een score hebben. Een summatieve toets telt mee en is strenger: de opbouw is een aparte halte die jij goedkeurt, vragen die letterlijk in de les voorkwamen zijn niet toegestaan (tenzij jij dat aanzet, bij woordjes of formules), en de vorm is een formulier. Daarnaast komt de gerichte toets: alleen wat bij deze klas nog wankelt, met per vraag de reden erbij.
Wat we níet beweren.
Een toets is pas goed als hij meet wat hij moet meten. Daar zijn we eerlijk over, ook waar het ons niet uitkomt.
Dat een vraag goed is omdat AI hem goedkeurde
Onze AI-lezers zijn een zeef, geen keurmerk. Ze vangen weggevers, overlap en vragen buiten de stof. Een subtiele dubbelzinnigheid kan erdoor. Daarom staat elk signaal bij de vraag, en daarom bestaat het nakijkblad voor een collega.
Dat we weten hoe moeilijk een vraag is
Dat blijkt pas als een klas de toets maakt. Het scherm zegt dat letterlijk. Na een afname rekenen we per vraag uit hoe hij zich gedroeg, en pas dan is er iets over moeilijkheid te zeggen.
Dat een toets uit één les een cijfer draagt
Onder de 25 punten waarschuwt GoYou: één gok of één slordigheid verschuift dan de uitslag. Een toets die meetelt uit één les noemen we een overhoring, en dat zeggen we ook.
Dat het denkniveau klopt omdat het erop staat
Een vraag die “toepassen” heet terwijl het antwoord letterlijk in de les stond, is een reproductievraag. Dit was de grootste zwakte die we bij onszelf hebben gemeten, en de reden voor de tweede lezer met bewijsplicht.
Ons toetsbeleid
Wat we doen, en wat we nooit doen.
Geen surveillance, nooit
Geen AI-detector, geen proctoring, geen webcam, geen emotieherkenning. Wat we wel vastleggen (dat een antwoord geplakt is, dat een scherm is verlaten) is een feit, deterministisch, en de leerling weet het vóór de start.
Geen leerlinggegevens naar het model
Voor het maken van een toets gaan alleen de lesstof en het onderwijsniveau naar het model. Geen naam, geen klas, geen school, geen woonplaats.
Een toets die meetelt is een formulier
Elke leerling dezelfde vragen, dezelfde volgorde van onderdelen, dezelfde tijd. Een AI die tijdens een meetellende toets doorvraagt maakt de uitslag onvergelijkbaar, dus dat doet hij niet. Bij formatief mag de tutor wel meepraten.
De cesuur is een redenering, geen gewoonte
GoYou laat zien wat alleen gokken oplevert en wat een cesuur daardoor werkelijk betekent. Je kunt per leerdoel aanwijzen wat elke leerling die net voldoende haalt moet kunnen; de cesuur volgt daaruit en is uit te leggen aan een ouder of een examencommissie.
Punten worden verdiend per onderdeel
Vier van de vijf goed geplaatst is geen nul. Elke vraagvorm heeft een scoringsregel in gewone taal die bij de vraag staat, en die de leerling zelf kan narekenen. Een volgorde-vraag is gecorrigeerd voor kans.
Een cijfer verandert nooit door een machine
GoYou stelt voor, jij accordeert. Na vrijgave kan een leerling de tutor vragen waarom iets fout was; de score verandert daar nooit van. Wie het oneens is komt bij jou terecht. Wij houden geen cijferadministratie bij.
Gebouwd alsof de strengste regels al gelden
De Europese AI-verordening rekent toetsing in het onderwijs tot de hoog-risicotoepassingen. Wij bouwen alsof die regels nu al gelden: een mens die elke stap kan tegenhouden, logging van elke modelstap, een gebruiksaanwijzing en een toetsdossier met alle keuzes en metingen.
Examinering doen we niet
Schoolexamens en centrale examens vallen buiten GoYou. Wel leggen we nu al vast wat een examencommissie later zou vragen: versienummer, bevriezen per toets, volledige logging.
Hoe we onszelf controleren.
Een regel in een instructie aan de AI telt bij ons pas als een meting laat zien dat hij werkt. Daarom draaien we een vaste meetset: tien vaste bronnen, van groep 7 tot en met 5 vwo en mbo, elke keer dezelfde, met grenswaarden die vooraf vaststaan. Staat de meetset rood, dan blijft hij rood tot het echt beter is; we praten hem niet groen.
Wat die meetset ons in september 2026 leerde: te veel vragen vroegen een lager denkniveau dan er op stond. Een vraag heette “toepassen” terwijl het antwoord woordelijk in de les stond. Daarom leest nu een onafhankelijk model elke vraag, moet het “onthouden” bewijzen met een citaat uit de stof, en wordt een vraag onder zijn niveau herschreven. Wat daarna nog te laag leest, draagt een zichtbaar signaal voor de docent. Dit is niet opgelost, en daarom staat het hier.
Wat wij zelf niet kunnen meten, laten we door anderen doen. Een vaste set gegenereerde vragen ligt klaar voor beoordeling door een onafhankelijke toetsdeskundige, blind: zonder ons bedoelde niveau en zonder onze signalen. Hoeveel afgekeurde vragen bij ons zónder signaal waren doorgeglipt, is het cijfer dat telt. Na een echte afname komen daar de klassieke maten bij: hoe moeilijk een vraag bleek, hoe goed hij onderscheidt, en hoe betrouwbaar de toets als geheel is.
De volledige verantwoording, met elke keuze, wat er afviel en alle metingen, staat in ons toetsdossier. Dat delen we met scholen die het willen lezen; vraag ernaar viacontact.
Voor wie er dieper in wil
Waar dit op steunt.
Niets hiervan is nieuw; het is wat de toetsleer al decennia zegt, in software gezet. Een toets die volgt uit de leerdoelen en de lessen ertussen (constructive alignment). Een toetsmatrijs vóór de vragen. Denkniveaus naar de herziene taxonomie van Bloom, gemeten aan wat er behandeld is en niet aan het werkwoord in de vraag. Kanscorrectie bij gokbare vormen. Een cesuur die uit de inhoud volgt in plaats van uit gewoonte. Deelpunten omdat alles-of-niets informatie weggooit. En na afname: p-waarden, onderscheidend vermogen en betrouwbaarheid, de maten waar een Nederlandse toetsdeskundige naar vraagt.
Nog een vraag over toetsen?
Vraag het de ondersteuner van GoYou: wat een toets wel en niet doet, hoe de cesuur werkt, en wat er met de antwoorden van leerlingen gebeurt.