careerguide.nl

AI-modellen nog niet klaar voor zelfstandig juridisch onderzoek

Blog
16-09-2026
Mark Zijlstra
AI-modellen zijn nog onvoldoende betrouwbaar om Nederlands juridisch onderzoek zelfstandig uit te voeren. Een nieuwe openbare benchmark laat vooral zien dat modellen moeite hebben om juridische regels correct op concrete feiten toe te passen.

Legal Benchmarks testte 23 modellen met DELTA, een benchmark met vijftien opdrachten uit verschillende Nederlandse rechtsgebieden en 273 door juristen gevalideerde criteria. Het best presterende model behaalde volgens columnist Mark Zijlstra een task pass rate van slechts 15 procent. Die lage score vraagt wel om nuance: een opdracht geldt alleen als geslaagd wanneer aan alle inhoudelijke eisen, bronvereisten en vormcriteria is voldaan. Eén gemist wetsartikel kan daardoor de volledige opdracht doen mislukken. Toch laten voorbeelden een wezenlijker probleem zien. Modellen vinden regelmatig de juiste rechtsregel of jurisprudentie, maar slagen er vervolgens niet in deze correct op de feiten van de zaak toe te passen.

Juist daarin zit volgens Zijlstra het belangrijkste risico voor juristen. Controle op verzonnen bronnen alleen is niet voldoende; ook een juridisch overtuigend antwoord met bestaande bronnen kan inhoudelijk verkeerd zijn. DELTA maakt dergelijke tekortkomingen meetbaar en is bovendien openbaar, zodat juristen de criteria kunnen controleren en verbeteren. De benchmark testte foundation models en geen gespecialiseerde juridische AI-tools, waardoor de resultaten niet zonder meer voor alle legaltech gelden. De belangrijkste betekenis ligt daarom in het zichtbaar maken waar menselijk toezicht noodzakelijk blijft: juridische expertise is niet minder, maar juist belangrijker wanneer AI een grotere rol in juridisch onderzoek krijgt.

Dit is een samenvatting van de volledige tekst op Mr.