Een AI scribe is geen scriba maar een medisch adviseur (en daarom klasse IIa MDR)

Photo by Nick Fewings on Unsplash

Een lastig debat in de AI-Act wereld: is een AI scribe hoogrisico? Heel kort door de bocht is dat tekst-naar-spraaksoftware die een consult transcribeert en er samenvattingen met actiepunten van maakt. De Zweedse toezichthouder heeft recent bepaald dat dit wél hoogrisico is, terwijl eerder vaak werd verdedigd van niet.

De classificatie is een samenloop met de MDR, de Medical Device Regulation die strikte regels voor medische hulpmiddelen stelt. Die kent vier klassen, om onnavolgbare redenen I, IIa, IIb en III geheten. Producten in klasse IIa en hoger mogen pas op de markt na externe goedkeuring, een klasse I product heeft dat niet nodig.

De AI verordening verklaart producten met AI hoogrisico wanneer ze onder hun ‘eigen’ regulering een externe goedkeuring nodig hebben. Bij medische producten dus als ze MDR IIa of hoger zijn, waardoor medtech-aanbieders héél graag in klasse I willen blijven.

Een populair medisch AI-hulpmiddel is dus die scribe, omdat je als arts veel conversatie hebt en geen tijd krijgt voor het uitwerken daarvan. Tekst-naar-spraakomzetting scheelt, maar dan krijg je een lap tekst van het gesprek. Wat je eigenlijk wilt, zijn klinische notities, patiëntbrieven of behandelplannen op basis van het gesprek. De belofte van scribe-aanbieders is dat ze dát voor je kunnen doen.

De meeste classificatieregels uit de MDR gaan over “echte” hulpmiddelen, van steriele naalden tot chirurgische robots zeg maar. Voor software is er één relevante regel, bijlage VIII regel nummer 11:

Software voor het verstrekken van informatie die gebruikt wordt bij het nemen van beslissingen voor diagnostische of therapeutische doeleinden behoort tot klasse IIa, tenzij [leven en dood of fysiologisch monitoren, dan IIb of III] Alle overige software behoort tot klasse I.
De argumentatie ligt voor de hand: scribe software is “overig” want niet betrokken bij de besluitvorming. Daar denken ze in Zweden nu anders over. Het volledige rapport is nog niet beschikbaar, maar AI-leverancier Tandem zegt er over:
Sweden’s Medical Products Agency’s position is that the completed documentation generated by the scribe is used as the basis for decisions in the continued care process, not just the current visit. That is what brings it under the higher classification.
Je zou immers kunnen zeggen dat de AI-uitvoer naar de arts gaat, die er dan nog wat mee doet en dát in het dossier stopt. Dan is het de arts die de klinische notitie of brief maakt. Maar omdat het structureel is, is het toch echt de AI-tool zelf die het behandelplan, brief of notitie maakt.

De Zweden formuleren drie vuistregels:

  • De uitvoer wordt in het verdere zorgproces als zodanig gebruikt, ongeacht of deze zelf een beslissing vormt.
  • Het AI-product ontstijgt de pure transcriptie en doet ook zaken als inferentie, structureren en interpretatie van de transcriptie (zoals die klinische notities).
  • Het doet er niet toe of de AI-uitvoer voor of na het nemen van de behandelbeslissing door de arts aangeleverd wordt (zie punt 1).
 

Die tweede vuistregel is uiteindelijk de belangrijkste. Bij Tandem werd in de eigen risicobeoordeling genoemd dat een interpretatiefout tot risico’s voor de patiënt kan leiden. Daarmee staat vast dat de verdere behandeling wordt beïnvloed door de AI-uitvoer. (Wie HBO heeft, moet The Pitt kijken en zal dan zien hoe dit mis kan gaan. CAICO’s en CHCO’s: 1 PE punt.)

Steeds meer marktpartijen zijn nu bezig met een MDR klasse IIa certificering. De grote uitdaging hierbij is dat er nog geen standaarden zijn voor het AI-gedeelte hiervan. Mede hierom is de toepasselijkheid van de AI-verordening op medische hulpmiddelen uitgesteld tot 2 augustus 2028. Maar door beslissingen als deze moet je er nú al iets mee als leverancier.

Arnoud

7 reacties

    1. Dan moet je naar de risicotoepassingen uit Bijlage III AI Verordening kijken. Daar staan zaken in als beoordelen van leerlingen of sollicitanten. Als je zo’n AI-scriba niet een behandelplan maar een remedial teaching plan laat maken, of de vervolguitnodiging dan wel afwijzingsbrief laat kiezen en maken, dan kom je alsnog bij hoogrisico. Zo’n ding inzetten voor de notulen en actielijst van de spreekwoordelijke visvereniging is geen hoogrisico.

  1. Terechte beslissing, om een dergelijk “scribe” die zwaardere classificatie te geven. Het gevaar van dergelijke hulpmiddelen zit erin dat ze het meestal goed doen, maar soms gigantische blunders maken. Dat zorgt ervoor dat artsen de uitvoer van een dergelijk systeem altijd moeten toetsen, maar hun aandacht daarbij zal verslappen, en het dus mis gaat.

    Cory Doctorow spreek met een prachtige metafoor van een “Reverse Centaur”: een mens met een paardenkop, omdat in zulke situaties de mens wordt gereduceerd tot een appendix van de machine, die bovendien gaat dienen als een soort van “Liability sink”, het afvoerputje voor verantwoordelijkheid, zodat de makers van dit soort tools buiten schot kunnen blijven. Dat wil je niet.

  2. Ik heb MDA trajecten begeleid, en daar ook deze discussie gevoerd met de Notified Body (een van de aangewezen certificeerders in Nederland). Het ging hier om de implementatie van “Synoptic reporting” in de pathologie (lees geautomatiseerde hard gecodeerde beslisbomen als vervanging van een heel dik boek), wat in praktijk bepalend is voor het diagnosticeren en behandelen van kanker. Daar lag een scheidslijn heel duidelijk bij controleerbaarheid door de arts: als de tool ingezet werd als een notepad++ en alleen de bepalingen in een leesbare vorm herhaalde, en de diagnose eigenlijk een herhaling daarvan was (of een extreem triviale afleiding was), dan waren fouten door de tooling door de arts goed te herkennen, ook in het hoog volume routineproces. Kijk je naar de complexe beslisbomen, waar je anders eigenlijk dat dikke boek echt voor nodig had, dan kom je al snel tot de conclusie dat in praktijk de beslisboom de medische beslissing neemt, en niet de arts. De arts zet dan wel zijn handtekening, maar hij kan de conclusie niet meer echt controleren (of het is te tijdsrovend om dat te doen). En dan wordt de MDR gewoon terecht veel strenger: de beslissing van de arts wordt immers vervangen door software.

    Bij de MDR gaat dan om het klinisch valideren van de output. Daar is eigenlijk geen AI act voor nodig: je hebt gewoon met klinische validaties aan te tonen dat het tool beter werkt dan een arts, of dat nu een AI is of een hard gecodeerde beslisboom. Het fundamentele probleem is dat een hardgecodeerde beslisboom die een klinische handleiding van de WHO slechts “uitcodeert” veel makkelijker te valideren is dan iets dat op tekst getrained is, intern geen deterministische beslisstructuur kent, en morgen wellicht iets anders beslist over exact dezelfde data. En zo’n bewegend doel, daar reageert certificering extreem slecht op.

  3. Zo’n classificatiefout gaat sneller en dramatischer mis indien door mensen uitgevoerd. De AI act op deze wijze eist absolute zekerheid voorspelbaarheid waardoor een slechter resultaat wordt bereikt dan nodig is.

    Worden de vele vermijdbare doden nu toegerekend aan het onvoldoende zijn zijn van een act? Afwachtend toekijken waar hulp op zijn plaats is is wettelijk een misdaad.

    Als de afweging ontbreekt kom je je in het tegengestelde zwarte scenario

    1. De AI Verordening eist nergens absolute zekerheid of voorspelbaarheid of 100% kwaliteit of 100% foutloosheid. Ook niet als het om een hoog risico AI-systeem gaat. De wet eist wel “een passend niveau van nauwkeurigheid, robuustheid en cyberbeveiliging…, alsook consistente prestaties gedurende de levensduur met betrekking tot deze aspecten” en “zo goed mogelijk bestand tegen fouten en onregelmatigheden zijn”. Ook verder normaliter heel goede hoog risico AI hoeft dus (net als mensen) niet steeds 100% perfect te zijn. Of het in een specifiek geval acceptabel en ethisch verantwoord is om niet 100% perfecte AI (die wel aan de wet voldoet) te gaan gebruiken, wordt niet door de AI Verordening bepaald. Als een AI toepassing vele malen meer levens kan redden dan werken zonder de AI toepassing (en mensen normaliter niet dood gaan door gebruik van de AI toepassing zelf), dan zal dat ongetwijfeld veelal een sterk argument voor ingebruikname ervan zijn. Al dan niet met in bepaalde situaties soms een verplichte herbeoordeling door een menselijke expert.

Geef een reactie

Handige HTML: <a href=""> voor hyperlinks, <blockquote> om te citeren, <UL>/<OL> voor lijsten, en <em> en <strong> voor italics en vet.