Dutch Data Prize 2024 winnaar: FAIR data over bevolkings- en gezinsdynamiek voor toekomstig onderzoek

Het Generations and Gender Programme (GGP) is een internationale onderzoeksinfrastructuur die onderzoekers en beleidsmakers voorziet van data over bevolkings- en gezinsdynamiek. De inzet van GGP om deze data Findable, Accessible, Interoperable and Reusable (FAIR) te maken, werd bekroond met de Dutch Data Prize 2024. Olga Grunwald, postdoconderzoeker bij het Nederlands Interdisciplinair Demografisch Instituut (NIDI-KNAW), vertelt hoe GGP werkt aan FAIR data, waarom dit belangrijk is voor onderzoek en wat het winnen van de Dutch Data Prize voor het programma betekent.

GGP werd opgericht in 2000 en is sinds 2009 gevestigd bij NIDI-KNAW. Het programma biedt vrij toegankelijke, internationaal vergelijkbare data over demografische veranderingen. De datasets omvatten onder meer de Generations and Gender Survey (GGS) en de Fertility and Family Surveys (FFS), met gegevens van meer dan 300.000 mensen uit ruim 30 landen.

De GGS, het belangrijkste onderzoek binnen GGP, volgt de levensloop van mensen tussen de 18 en 79 jaar in verschillende landen. Met deze data kunnen onderzoekers maatschappelijke vraagstukken bestuderen rond onder meer vruchtbaarheid, de financiële en sociale omstandigheden van jongvolwassenen, gezinsvorming en relaties tussen generaties.

Data toegankelijk en herbruikbaar maken

GGP past de FAIR-principes toe op zowel de microdata als de metadata. Onderzoekers kunnen zich via het GGP Data Portal registreren om toegang te krijgen tot de microdata. De data zijn beschikbaar in veelgebruikte formaten, waaronder SPSS, Stata en CSV. Omdat de datasets gevoelige informatie bevatten, hanteert GGP het principe ‘as open as possible, as closed as necessary’. Daarmee zoekt het programma naar een balans tussen toegankelijkheid en passende bescherming van de privacy.

De metadata worden gedocumenteerd volgens de DDI-Lifecycle 3-standaard en zijn via het Colectica-portaal van GGP open beschikbaar in JSON- en DDI-XML-formaat. GGP gebruikt daarnaast gecontroleerde vocabularia van CESSDA om de consistentie en interoperabiliteit tussen datasets te verbeteren. Verdere ontwikkelingen zijn onder meer het vastleggen van provenance metadata, het toekennen van DOI’s aan de microdata en het werken aan CoreTrustSeal-certificering.

Een groot deel van dit werk wordt uitgevoerd door collega’s van de GGP Central Hub bij NIDI, in samenwerking met collega’s van het Franse demografische instituut INED.

Data ook op lange termijn begrijpelijk houden

Voor GGP zijn FAIR data met name belangrijk omdat datasets ook na tientallen jaren nog waardevol kunnen zijn voor onderzoek. De ervaringen met de Fertility and Family Surveys uit de jaren negentig illustreren dit. Deze onderzoeken vormen nog altijd een waardevolle bron, maar omdat ze dateren van vóór de ontwikkeling van de FAIR-principes, is het soms moeilijk om bepaalde keuzes uit die tijd te reconstrueren.

Deze ervaring laat volgens GGP zien hoe belangrijk gedetailleerde en gestructureerde documentatie is. Door de FAIR-principes toe te passen, kunnen toekomstige onderzoekers de context, methodologie en structuur van data ook vele jaren na de oorspronkelijke dataverzameling begrijpen. Dit draagt bovendien bij aan transparantie, vertrouwen en effectief hergebruik.

Het winnen van de Dutch Data Prize is dan ook een belangrijke erkenning voor het werk dat GGP heeft verricht om de FAIRness van zijn data te verbeteren. ‘De afgelopen twee jaar hebben we veel tijd en energie gestoken in het begrijpen van wat de FAIR-principes werkelijk betekenen en hoe we deze kunnen toepassen op GGP en onze data’, vertelt Grunwald. ‘Deze erkenning bevestigt voor ons dat we op de goede weg zijn.’

Voortbouwen op de Dutch Data Prize

GGP overweegt verschillende manieren om het prijzengeld te gebruiken om de data verder te verbeteren. Een van de mogelijkheden is het organiseren van een hackathon waarin onderzoekers en experts samenwerken aan een betere interoperabiliteit tussen datasets in het GGP Data Portal. Een ander idee is om oudere datasets, waaronder de FFS, meer FAIR te maken door de metadata, documentatie en toegankelijkheid te verbeteren.

Grunwald moedigt ook andere onderzoekers aan om hun datasets voor te dragen voor de Dutch Data Prize. Het voorbereiden van een nominatie biedt volgens haar een goede gelegenheid om stil te staan bij de eigen datapraktijk en te beoordelen hoe deze aansluit bij de FAIR-principes.

‘Inspanningen op het gebied van datamanagement blijven vaak buiten beeld. De Dutch Data Prize biedt een kans om het belang van FAIR data zichtbaar te maken en aandacht te geven aan de bijdrage die goed beheerde en herbruikbare data leveren aan de bredere onderzoeksgemeenschap’, aldus Grunwald.