Bram van Dijk, post-doc onderzoeker bij de Health Campus, presenteerde onlangs bij de Medical Informatics Europe Conference de bevindingen van een proef met een nieuwe tool genaamd OpenExtract. Het prototype van deze tool, ontwikkeld door het TDS-lab, blijkt vaak de correcte en relevante informatie te kunnen halen uit een grote hoeveelheid wetenschappelijke papers.
OpenExtract, een slimme en snelle manier om informatie te verzamelen uit grote hoeveelheden papers. Uit onderzoek (gepubliceerd in IOS Press door o.a. Jim Achterberg) blijkt nu dat deze tool goed werkt om relevante en correcte informatie uit de papers te halen, ideaal om te gebruiken voor een Systematic Literature review.
De tool werd ontwikkeld door het Translational Data Science lab, aangevoerd door hoogleraar geavanceerde datawetenschap in populatiegerichte zorg en Health Campus collega Marco Spruit.
Nu de proef succesvol blijkt te zijn wordt het prototype van de tool verder ontwikkeld, verfijnd en gevalideerd door clinici en onderzoekers van het UNCAN-project.
Bram van Dijk mocht dit verhaal vertellen tijdens het Medical Informatics Europe Conference.
Lees het gepubliceerde paper via onderstaande link (auteurs: Jim Achterberg, Bram van Dijk, Jing Meng, Said Ul Islam, Gregory Epiphaniou, Carsten Maple, Xuefei Ding, Theodoros N. Arvanitis, Simon Brouwer, Marcel Haas, Marco Spruit)
De studie test de werking van OpenExtract, een open-source tool die met behulp van AI automatisch gegevens kan halen uit wetenschappelijke artikelen. Dit is vooral bedoeld voor systematic reviews, waarbij onderzoekers vaak honderden of duizenden artikelen analyseren. Normaal gesproken is dit een tijdrovend en handmatig proces.
OpenExtract gebruikt grote taalmodellen (LLM’s) en een techniek genaamd retrieval-augmented generation (RAG). Daarbij zoekt het systeem eerst de meest relevante tekstfragmenten uit een artikel en geeft deze als context aan een AI-model. De AI kiest vervolgens het juiste antwoord op een vraag uit een vooraf bepaalde lijst. Hierdoor baseert het systeem zijn antwoorden op de inhoud van het artikel zelf, in plaats van alleen op algemene kennis.
De onderzoekers testten OpenExtract op een literatuurstudie binnen de digitale gezondheidszorg. Na een eerste selectie van meer dan 7.000 artikelen bleven 249 relevante studies over. Voor de evaluatie werden 50 artikelen gekozen, waarvan de eerste 10 zijn geanalyseerd en vergeleken met handmatig werk van twee onderzoekers.
De resultaten laten zien dat OpenExtract goed presteert: de nauwkeurigheid (precision) en volledigheid (recall) liggen beide rond of boven de 80%. Dit betekent dat de tool vaak de juiste informatie vindt en weinig belangrijke gegevens mist. Wel blijkt dat menselijke onderzoekers vaker met elkaar overeenstemmen dan met de AI. Ook lijken AI-modellen onderling op elkaar te lijken in hun fouten, wat wijst op mogelijke bias.
Een opvallende bevinding is dat grotere AI-modellen niet altijd beter presteren dan kleinere modellen. Middelgrote modellen waren soms even goed of beter, terwijl kleine modellen duidelijk minder goed scoorden.
De tool heeft ook beperkingen: hij analyseert alleen tekst en kan geen informatie uit tabellen of figuren halen. Daarnaast blijft interpretatie van complexe informatie een uitdaging voor AI.
De conclusie is dat OpenExtract een veelbelovende manier biedt om het werk in systematische reviews deels te automatiseren. Het kan onderzoekers veel tijd besparen en maakt het makkelijker om grote hoeveelheden literatuur te verwerken, maar menselijke controle blijft voorlopig noodzakelijk.
Het UNCAN-Connect project is een Horizon Europa project dat een veilig en slim netwerk bouwt om data over kanker uit heel Europa te delen en te analyseren. Met als doel dat onderzoekers en artsen de ziekte beter en sneller kunnen begrijpen, opsporen en behandelen.
Onderzoekers en clinici van dit project helpen mee aan de validatie en verfijning van de OpenExtract tool.
Lees meer via onderstaande link.
Het TDS-lab is een onderzoeksgroep die data science en AI gebruikt om echte problemen in de gezondheidszorg op te lossen. Ze slaan een brug tussen zorgpraktijk en technologie, zodat nieuwe data- en AI-oplossingen ook echt in de zorg gebruikt kunnen worden.
Het TDS-lab heeft een paar belangrijke doelen:
Het TDS-lab team bestaat uit collega’s van Universiteiten in Nederland. De volgende Health Campus collega’s zijn betrokken:
Lees meer over het TDS-lab op de website via onderstaande link.