Tag Archives: saatavuus

Being trustworthy and FAIR requires people, processes, technologies and collaboration

The Implementation Roadmap for the European Science Cloud (EOSC) puts focus on research data adhering to the FAIR principles of being findable, accessible, interoperable, and reusable. These are all excellent goals and the social science data archive community has been promoting similar ideas since at least the 1970’s. We know that managing, disseminating and preserving digital data for the long term is neither simple nor straightforward. Research data will not become nor stay FAIR by magic. We need skilled people, transparent processes, interoperable technologies and collaboration to build, operate and maintain research data infrastructures.

A key theme in digital preservation and thus in all FSD’s functions is trust. Data subjects need to be able to trust that data about them are handled in an appropriate way. Researchers need to have trust that FSD manages their data according to the agreements. FSD’s users need to be able to trust that they get access to reliable versions of data from FSD and that, for example, all changes made to the deposited datasets are documented. In short, FSD needs to be a trusted digital repository.

Shaping the trust landscape

Luckily, FSD is not alone. In addition to collaborating in national networks, FSD is the Finnish Service Provider for CESSDA ERIC (Consortium of European Social Science Data Archives). CESSDA requires that all its Service Providers adhere to the trustworthy digital repository requirements set by the CoreTrustSeal. In August 2017, FSD acquired the new CTS certification among the first CESSDA Service Providers.

FSD has been active in CESSDA’s trust work for several years and currently I am a member of the CESSDA Trust Working Group. The Group offers guidance and support to CESSDA members in understanding and acquiring the CoreTrustSeal and maintains an overview of the trust landscape including certification standards and the emergence of the FAIR data principles and the requirements of the EOSC. I am also a member of the CoreTrustSeal Board 2018–2021. These collaborations are essential for strengthening FSD’s expertise. They also provide unique insights to, and possibilities to be involved in, shaping the trust landscape.

Today is the World Digital Preservation Day. It brings together the digital preservation community to celebrate the collections preserved, the access maintained and the understanding fostered by preserving digital materials. I want to take this opportunity to celebrate FSD’s current and forthcoming collaborations and especially our staff’s great expertise and dedication. As the Chair of the CESSDA Trust Group Herve L’Hours has written: Technologies can be consolidated, and processes automated, but collection, creation, curation and research use/reuse of data is ultimately dependent on the domain and disciplinary expertise of the humans who know them best. (L’Hours 2018)

Happy Digital Preservation!

FSD’s work in CESSDA Trust Group and CoreTrustSeal are supported by CESSDA Trust Work Plan project and the Active FSD for CESSDA project funded by the Academy of Finland.

More information:

» Follow #WDPD2018 on Twitter
» CESSDA Trust Working Group
» CoreTrustSeal Board 2018-2021

Mari Kleemola
Development Manager
firstname.surname [at] uta.fi

Aineistojen avoimuus saattaisi ratkaista monta lääketieteen tutkimuksen ongelmaa

Tutkimusaineistojen avoimuus on päivän trendi. Ehkä vähän yllättäen myös arkaluonteista tietoa sisältävien aineistojen avaamisen puolesta puhuu yhä useampi tutkija, ja lääketieteen julkaisut ovat alkaneet vaatia artikkelin julkaisijoita avaamaan tutkimusaineistonsa. Nyt on hyvä hetki istua alas ja pohtia syitä, joiden vuoksi aineistojen avoimuutta halutaan edistää terveys- ja lääketieteen tutkimuksen alalla.

En tässä kirjoituksessa kajoa tietosuojakysymyksiin tai aineistojen avaamisesta tutkittaville koituviin hyötyihin. Jälkimmäisestä aiheesta on tulossa Tietoarkistoblogiin oma kirjoitus, ja Euroopan unionin yleisen tietosuojan kansallinen tulkinta on vielä sen verran kesken, että tietosuoja-asiaan kannattaa paneutua vasta myöhemmin. Kannattaa seurata Tietoarkiston tapahtumia, esimerkiksi loka-marraskuussa on luvassa kaksi aiheeseen liittyvää seminaaria.

Sitten takaisin blogin varsinaiseen aiheeseen.

Kaikessa tutkimuksessa, ei pelkästään terveys- ja lääketieteissä, on ongelmallista, jos tutkimustuloksia ei pystytä toistamaan. Lääketieteissä toistettavuuden puute johtaa epävarmuuteen siitä, mikä olisi paras tapa hoitaa potilaita. Lääketieteissä seuraukset ovat siis moniin muihin tieteenaloihin verrattuna erityisen vakavia.

Toistettavuuden puute voi johtua monista tekijöistä. Aineisto voi olla liian pieni, jolloin tulokset voivat olla sattumalöydöksiä. Aineistossa tai sen analyysissa käytetyissä menetelmissä voi olla puutteita, joiden seurauksena löytyy eroja, joita ei todellisuudessa ole. Tai yhteyttä ei ole olemassakaan, mutta vasta kun takana on riittävän monta laadukasta tutkimusta, jotka eivät hypoteesia vahvista, voidaan todeta, ettei hypoteesi pitänyt paikkaansa.

Tutkimusaineistojen avoimuutta halutaan, koska se parantaa tutkimuksen laatua ja laadukkaammat tutkimukset johtavat parempaan toistettavuuteen. Epidemiologisesta tutkimuksesta voidaan siirtyä nopeammin varsinaisten syy-yhteyksien selvittämiseen. Yhtenäisistä tutkimustuloksista saadaan käypä hoito -suosituksia, joiden perustana on vahva näyttö vaikuttavuudesta. Meta-analyyseihin kun pätee sama ”garbage in, garbage out” -periaate kuin monella muullakin alalla: meta-analyysi tai systemaattinen kirjallisuuskatsaus voi olla vain niin hyvä kuin ovat ne alkuperäiset tutkimustulokset, joiden pohjalta analyysit ja koosteet tehdään.

Tutkimusaineistojen avoimuuden lisääntyminen mahdollistaa myös yhä useammin yksilötason potilastietoihin perustuvat individual patient data (IPD)-meta-analyysit sen sijaan, että jouduttaisiin tyytymään pelkkiin artikkeleiden tarjoamiin tunnuslukuihin. Avoimien aineistojen avulla tutkimuksen tuloksia voi vertailla helposti toisenlaiseen populaatioon, (jonka dataa ei ole analysoitu vielä ihan samalla tavalla) ja löydökset joko vahvistuvat tai osoittautuvat merkityksettömiksi.

Avoimesta tutkimusaineistosta voi myös varmistaa alkuperäiset tulokset ja käytettyjen menetelmien asianmukaisuuden. On valitettavan tavallista vaihtaa ja muokata alkuperäisen kiinnostuksen kohteina olleita tulosmuuttujia, päävasteita, parempien tulosten toivossa. Avoin data auttaa varmistamaan, että alun perin kiinnostavat vasteet myös analysoidaan ja tulokset julkaistaan. Dataväärennöksiä datojen avaaminen tuskin kokonaan lopettaa, mutta niiden tekeminen ainakin vaikeutuu.

Sitten on hyvin tunnettu ongelma, eli julkaisuharha. Negatiivisia tutkimustuloksia ei haluta julkaista, tai vaikka haluttaisiinkin, niitä ei välttämättä saa julkaistua. Lääketehdas voi olla halukas hautaamaan vakavia sivuvaikutuksia tuottaneen lääkkeen tutkimuksen kokonaan ja samaa lääkeainetta voi sitten testata jokin muu taho tietämättä jo todettuja haittavaikutuksia. Jos kaikkien rekisteröityjen tutkimusten aineistot on pakko avata, näitä negatiivisia kokeita ei ole yhtä helppo haudata.

Tehdyistä tutkimuksista voi ottaa myös oppia. Julkaistusta datasta voi saada lisätietoa siitä, mitä taustatekijöitä on syytä ottaa huomioon satunnaistettaessa tutkittavia ryhmiin. Datan saattaminen muiden tutkijoiden käyttöön auttaa saamaan aiheeseen uusia näkökulmia ja havaitsemaan millainen tutkimus toimii ja millainen ei. Kaiken kaikkiaan tarve tutkia samoja ilmiöitä, hoitoja ja lääkkeitä yhä uudelleen vähenee.

Avoimuuden sivuilmiönä tutkijat kertovat tekevänsä tutkimusaineiston avaamiseen tähtäävää tutkimusta huomaamattaan hieman huolellisemmin kuin tutkimusta, jonka aineisto ja menetelmät jäävät vain heidän omaan käyttöönsä. Kun tietää joutuvansa perustelemaan jokaisen päätöksen, tulee tarkasteltua tarkemmin menetelmällisiä valintoja, joita aiemmin on pitänyt itsestään selvinä.

Tutkimusaineistojen avoimuus ei siis ehkä korjaa kaikkia lääketieteen tutkimuksen ongelmia, mutta auttaa kyllä hyvin monen nujertamisessa.

Annaleena Okuloff
erikoissuunnittelija, THL
Tietoarkiston entinen terveystieteiden tieteenala-asiantuntija
fsd [at] uta.fi

Aineistojen avoimuus saattaisi ratkaista monta lääketieteen tutkimuksen ongelmaa

Tutkimusaineistojen avoimuus on päivän trendi. Ehkä vähän yllättäen myös arkaluonteista tietoa sisältävien aineistojen avaamisen puolesta puhuu yhä useampi tutkija, ja lääketieteen julkaisut ovat alkaneet vaatia artikkelin julkaisijoita avaamaan tutkimusaineistonsa. Nyt on hyvä hetki istua alas ja pohtia syitä, joiden vuoksi aineistojen avoimuutta halutaan edistää terveys- ja lääketieteen tutkimuksen alalla.

En tässä kirjoituksessa kajoa tietosuojakysymyksiin tai aineistojen avaamisesta tutkittaville koituviin hyötyihin. Jälkimmäisestä aiheesta on tulossa Tietoarkistoblogiin oma kirjoitus, ja Euroopan unionin yleisen tietosuojan kansallinen tulkinta on vielä sen verran kesken, että tietosuoja-asiaan kannattaa paneutua vasta myöhemmin. Kannattaa seurata Tietoarkiston tapahtumia, esimerkiksi loka-marraskuussa on luvassa kaksi aiheeseen liittyvää seminaaria.

Sitten takaisin blogin varsinaiseen aiheeseen.

Kaikessa tutkimuksessa, ei pelkästään terveys- ja lääketieteissä, on ongelmallista, jos tutkimustuloksia ei pystytä toistamaan. Lääketieteissä toistettavuuden puute johtaa epävarmuuteen siitä, mikä olisi paras tapa hoitaa potilaita. Lääketieteissä seuraukset ovat siis moniin muihin tieteenaloihin verrattuna erityisen vakavia.

Toistettavuuden puute voi johtua monista tekijöistä. Aineisto voi olla liian pieni, jolloin tulokset voivat olla sattumalöydöksiä. Aineistossa tai sen analyysissa käytetyissä menetelmissä voi olla puutteita, joiden seurauksena löytyy eroja, joita ei todellisuudessa ole. Tai yhteyttä ei ole olemassakaan, mutta vasta kun takana on riittävän monta laadukasta tutkimusta, jotka eivät hypoteesia vahvista, voidaan todeta, ettei hypoteesi pitänyt paikkaansa.

Tutkimusaineistojen avoimuutta halutaan, koska se parantaa tutkimuksen laatua ja laadukkaammat tutkimukset johtavat parempaan toistettavuuteen. Epidemiologisesta tutkimuksesta voidaan siirtyä nopeammin varsinaisten syy-yhteyksien selvittämiseen. Yhtenäisistä tutkimustuloksista saadaan käypä hoito -suosituksia, joiden perustana on vahva näyttö vaikuttavuudesta. Meta-analyyseihin kun pätee sama ”garbage in, garbage out” -periaate kuin monella muullakin alalla: meta-analyysi tai systemaattinen kirjallisuuskatsaus voi olla vain niin hyvä kuin ovat ne alkuperäiset tutkimustulokset, joiden pohjalta analyysit ja koosteet tehdään.

Tutkimusaineistojen avoimuuden lisääntyminen mahdollistaa myös yhä useammin yksilötason potilastietoihin perustuvat individual patient data (IPD)-meta-analyysit sen sijaan, että jouduttaisiin tyytymään pelkkiin artikkeleiden tarjoamiin tunnuslukuihin. Avoimien aineistojen avulla tutkimuksen tuloksia voi vertailla helposti toisenlaiseen populaatioon, (jonka dataa ei ole analysoitu vielä ihan samalla tavalla) ja löydökset joko vahvistuvat tai osoittautuvat merkityksettömiksi.

Avoimesta tutkimusaineistosta voi myös varmistaa alkuperäiset tulokset ja käytettyjen menetelmien asianmukaisuuden. On valitettavan tavallista vaihtaa ja muokata alkuperäisen kiinnostuksen kohteina olleita tulosmuuttujia, päävasteita, parempien tulosten toivossa. Avoin data auttaa varmistamaan, että alun perin kiinnostavat vasteet myös analysoidaan ja tulokset julkaistaan. Dataväärennöksiä datojen avaaminen tuskin kokonaan lopettaa, mutta niiden tekeminen ainakin vaikeutuu.

Sitten on hyvin tunnettu ongelma, eli julkaisuharha. Negatiivisia tutkimustuloksia ei haluta julkaista, tai vaikka haluttaisiinkin, niitä ei välttämättä saa julkaistua. Lääketehdas voi olla halukas hautaamaan vakavia sivuvaikutuksia tuottaneen lääkkeen tutkimuksen kokonaan ja samaa lääkeainetta voi sitten testata jokin muu taho tietämättä jo todettuja haittavaikutuksia. Jos kaikkien rekisteröityjen tutkimusten aineistot on pakko avata, näitä negatiivisia kokeita ei ole yhtä helppo haudata.

Tehdyistä tutkimuksista voi ottaa myös oppia. Julkaistusta datasta voi saada lisätietoa siitä, mitä taustatekijöitä on syytä ottaa huomioon satunnaistettaessa tutkittavia ryhmiin. Datan saattaminen muiden tutkijoiden käyttöön auttaa saamaan aiheeseen uusia näkökulmia ja havaitsemaan millainen tutkimus toimii ja millainen ei. Kaiken kaikkiaan tarve tutkia samoja ilmiöitä, hoitoja ja lääkkeitä yhä uudelleen vähenee.

Avoimuuden sivuilmiönä tutkijat kertovat tekevänsä tutkimusaineiston avaamiseen tähtäävää tutkimusta huomaamattaan hieman huolellisemmin kuin tutkimusta, jonka aineisto ja menetelmät jäävät vain heidän omaan käyttöönsä. Kun tietää joutuvansa perustelemaan jokaisen päätöksen, tulee tarkasteltua tarkemmin menetelmällisiä valintoja, joita aiemmin on pitänyt itsestään selvinä.

Tutkimusaineistojen avoimuus ei siis ehkä korjaa kaikkia lääketieteen tutkimuksen ongelmia, mutta auttaa kyllä hyvin monen nujertamisessa.

Annaleena Okuloff
erikoissuunnittelija, THL
Tietoarkiston entinen terveystieteiden tieteenala-asiantuntija
fsd [at] uta.fi

Tietoarkisto on FAIR

Avoimen tieteen piirissä on viimeisen vuoden aikana alettu puhua FAIR-periaatteista. Kiinnostuksen selittänee pitkälti EU:n Horisontti 2020 -ohjelma, joka painottaa tutkimusaineistojen hyvää hallintaa ja FAIR-periaatteita.

FAIR on lyhenne sanoista Findable, Accessible, Interoperable ja Re-usable. Suomeksi voitaisiin puhua tutkimusaineistojen löydettävyydestä, saavutettavuudesta, yhteentoimivuudesta ja uudelleenkäytettävyydestä – kaikki periaatteita, joita Tietoarkisto on edistänyt jo kohta kaksikymmentä vuotta ja vanhimmat yhteiskuntatieteelliset sisararkistomme (kuten brittien UKDS) jo puoli vuosisataa.

Vaikka kyse ei olekaan meille uudesta asiasta, FAIR-keskustelu on tarjonnut oivan herätteen tarkastella Tietoarkiston toimintaa hieman erilaisesta näkökulmasta. Yksi sysäys tarkastelullemme oli myös marraskuussa OpenAIRE2020-hankkeen järjestämä työpaja. Siellä FAIR-periaatteista keskusteltiin erilaisia tutkimuksen tukipalveluja vertailukohtana käyttäen. Tietoarkisto oli yksi mukana olleista palveluista.

Koska tarjoamme aineistojen arkistointi- ja avaamispalvelujen lisäksi neuvontaa ja ohjausta tutkimusdatan hallintaan (ks. tieteenala-asiantuntijamme Katja Fältin oiva katsaus olemassa oleviin aineistonhallinnan resursseihin ja palveluihin, onkin aiheellista ja reilua kysyä: Kuinka FAIR Tietoarkisto on?

Vastaukseni on, että Tietoarkisto on erittäin FAIR. Tässä tiivistetyt perustelut:

  • Tietoarkistoon arkistoidut aineistot on kuvailtu yksityiskohtaisesti. Metadata on vapaasti saatavilla ja hyödynnettävissä, vaikka datassa voi olla rajoituksia. Annamme aineistoille aina pysyvän tunnisteen. Aineistot ovat löydettävissä Tietoarkiston oman Aila-palveluportaalin kautta ja esimerkiksi myös kansallisten Finna- ja Etsin-palveluiden kautta.
  • Metadata on vapaasti saatavilla Ailan kautta sekä Tietoarkiston OAI-PMH-rajapinnasta. Rekisteröityneet käyttäjät voivat ladata dataa Ailasta. Aila hyödyntää HAKA-käyttäjätunnistusjärjestelmää.
  • Tietoarkisto käyttää aineistojen kuvailuun kansainvälistä DDI Codebook -kuvailuformaattia sekä useita kansainvälisiä sanastoja. Metadata sisältää myös viittauksia muuhun metadataan, dataan ja julkaisuihin. Data on saatavilla yhteiskuntatieteilijöiden yleisesti käyttämässä SPSS-formaatissa.
  • Aineistojen DDI Codebook -muotoinen metadata sisältää laajasti tietoa aineiston sisällöstä, tekijöistä, keruusta, muuttujista ja aineistoon viittaamisesta. Datan käyttöehdot ovat selkeät ja sisältyvät metadataan. Metadata on saatavilla CC-lisenssillä.

Tietoarkiston kannalta haasteellisin FAIR-periaate on yhteentoimivuus. FAIRin taustalla on idea koneellisesti saavutettavasta, käsiteltävästä ja tulkittavasta tiedosta. Se ei Tietoarkiston datan osalta toteudu täydellisesti, mutta mielestämme kuitenkin niin hyvin kuin on mahdollista ja tarkoituksenmukaista.

Marraskuun OpenAIRE2020-seminaarissa pohdittiinkin, mikä riittää siihen, että datan, organisaation tai palvelun voi sanoa olevan FAIR. Mitään yhtä vastausta tähän ei saatu – eikä mielestäni tarvitsekaan saada.

Esimerkiksi organisaatioiden toiminnan arviointiin on olemassa yksityiskohtaisia sertifikaatteja ja standardeja kuten OAIS, Data Seal of Approval ja ISO 16363. FAIR-periaatteet ovat sen sijaan iskevästi nimettyjä ja ilmaistuja yleisiä tavoitteita, ja ne toimivat sellaisina hyvin.

Tietoarkiston käytäntöjen FAIR-yhteensopivuus ei ollut yllätys, onhan meillä jo DSA-sertifikaatti. Aina on kuitenkin varaa parantaa, ja FAIR-periaatteet auttavat hahmottamaan, mitkä osa-alueet ovat vahvoja ja minkä osa-alueiden kehittämistä tulisi tutkiskella tarkemmin. Uskon, että FAIR-periaatteiden avulla on myös helppo herättää yleisempää keskustelua tutkimusaineistojen avaamisesta ja hallinnasta sekä niihin liittyvistä hyvistä käytännöistä.

Lisätietoa FAIR-periaatteista:
Wilkinson, Mark D. et al (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data 3, Article number 160018. http://dx.doi.org/10.1038/sdata.2016.18

Mari Kleemola
kehittämispäällikkö
etunimi.sukunimi [at] uta.fi

Tietoarkisto on FAIR

Avoimen tieteen piirissä on viimeisen vuoden aikana alettu puhua FAIR-periaatteista. Kiinnostuksen selittänee pitkälti EU:n Horisontti 2020 -ohjelma, joka painottaa tutkimusaineistojen hyvää hallintaa ja FAIR-periaatteita.

FAIR on lyhenne sanoista Findable, Accessible, Interoperable ja Re-usable. Suomeksi voitaisiin puhua tutkimusaineistojen löydettävyydestä, saavutettavuudesta, yhteentoimivuudesta ja uudelleenkäytettävyydestä – kaikki periaatteita, joita Tietoarkisto on edistänyt jo kohta kaksikymmentä vuotta ja vanhimmat yhteiskuntatieteelliset sisararkistomme (kuten brittien UKDS) jo puoli vuosisataa.

Vaikka kyse ei olekaan meille uudesta asiasta, FAIR-keskustelu on tarjonnut oivan herätteen tarkastella Tietoarkiston toimintaa hieman erilaisesta näkökulmasta. Yksi sysäys tarkastelullemme oli myös marraskuussa OpenAIRE2020-hankkeen järjestämä työpaja. Siellä FAIR-periaatteista keskusteltiin erilaisia tutkimuksen tukipalveluja vertailukohtana käyttäen. Tietoarkisto oli yksi mukana olleista palveluista.

Koska tarjoamme aineistojen arkistointi- ja avaamispalvelujen lisäksi neuvontaa ja ohjausta tutkimusdatan hallintaan (ks. tieteenala-asiantuntijamme Katja Fältin oiva katsaus olemassa oleviin aineistonhallinnan resursseihin ja palveluihin, onkin aiheellista ja reilua kysyä: Kuinka FAIR Tietoarkisto on?

Vastaukseni on, että Tietoarkisto on erittäin FAIR. Tässä tiivistetyt perustelut:

  • Tietoarkistoon arkistoidut aineistot on kuvailtu yksityiskohtaisesti. Metadata on vapaasti saatavilla ja hyödynnettävissä, vaikka datassa voi olla rajoituksia. Annamme aineistoille aina pysyvän tunnisteen. Aineistot ovat löydettävissä Tietoarkiston oman Aila-palveluportaalin kautta ja esimerkiksi myös kansallisten Finna- ja Etsin-palveluiden kautta.
  • Metadata on vapaasti saatavilla Ailan kautta sekä Tietoarkiston OAI-PMH-rajapinnasta. Rekisteröityneet käyttäjät voivat ladata dataa Ailasta. Aila hyödyntää HAKA-käyttäjätunnistusjärjestelmää.
  • Tietoarkisto käyttää aineistojen kuvailuun kansainvälistä DDI Codebook -kuvailuformaattia sekä useita kansainvälisiä sanastoja. Metadata sisältää myös viittauksia muuhun metadataan, dataan ja julkaisuihin. Data on saatavilla yhteiskuntatieteilijöiden yleisesti käyttämässä SPSS-formaatissa.
  • Aineistojen DDI Codebook -muotoinen metadata sisältää laajasti tietoa aineiston sisällöstä, tekijöistä, keruusta, muuttujista ja aineistoon viittaamisesta. Datan käyttöehdot ovat selkeät ja sisältyvät metadataan. Metadata on saatavilla CC-lisenssillä.

Tietoarkiston kannalta haasteellisin FAIR-periaate on yhteentoimivuus. FAIRin taustalla on idea koneellisesti saavutettavasta, käsiteltävästä ja tulkittavasta tiedosta. Se ei Tietoarkiston datan osalta toteudu täydellisesti, mutta mielestämme kuitenkin niin hyvin kuin on mahdollista ja tarkoituksenmukaista.

Marraskuun OpenAIRE2020-seminaarissa pohdittiinkin, mikä riittää siihen, että datan, organisaation tai palvelun voi sanoa olevan FAIR. Mitään yhtä vastausta tähän ei saatu – eikä mielestäni tarvitsekaan saada.

Esimerkiksi organisaatioiden toiminnan arviointiin on olemassa yksityiskohtaisia sertifikaatteja ja standardeja kuten OAIS, Data Seal of Approval ja ISO 16363. FAIR-periaatteet ovat sen sijaan iskevästi nimettyjä ja ilmaistuja yleisiä tavoitteita, ja ne toimivat sellaisina hyvin.

Tietoarkiston käytäntöjen FAIR-yhteensopivuus ei ollut yllätys, onhan meillä jo DSA-sertifikaatti. Aina on kuitenkin varaa parantaa, ja FAIR-periaatteet auttavat hahmottamaan, mitkä osa-alueet ovat vahvoja ja minkä osa-alueiden kehittämistä tulisi tutkiskella tarkemmin. Uskon, että FAIR-periaatteiden avulla on myös helppo herättää yleisempää keskustelua tutkimusaineistojen avaamisesta ja hallinnasta sekä niihin liittyvistä hyvistä käytännöistä.

Lisätietoa FAIR-periaatteista:
Wilkinson, Mark D. et al (2016). The FAIR Guiding Principles for scientific data management and stewardship. Scientific Data 3, Article number 160018. http://dx.doi.org/10.1038/sdata.2016.18

Mari Kleemola
kehittämispäällikkö
etunimi.sukunimi [at] uta.fi

Orvot aineistot

Tietoarkisto on uusinut arkistointia koskevan sopimuksen ja aineistojen jatkokäyttöä koskevat käyttöehdot. Arkistointisopimuksessa halusimme erityisesti täsmentää tilanteita, joissa alkuperäinen tutkija edellyttää häneltä luvan kysymistä jokaiseen aineiston jatkokäyttöön.

Testasimme uuden sopimuksen ehtoja jo viime syksynä muutamien tutkijoiden kanssa. Osa hämmentyi pyynnöstä nimetä vaihtoehtoinen toimintatapa tai toinen henkilö, jolta lupaa aineiston käyttöön voi kysyä, jos aineiston arkistoitunutta henkilöä itseään ei tavoiteta. ”Ei kukaan muu voi antaa käyttöön lupaa, ei vain voi”, sanoi yksi tutkija. Lyhyen hiljaisuuden jälkeen hän itse totesi kuolevansa tietysti joskus.

Tutkijat ja tietoarkiston henkilökunta siirtyvät aikanaan eläkkeelle ja kuolevat. Toisinaan elämän kulkua muuttaa sairaus tai tapaturma. Tietoarkistoon arkistoitu aineisto sen sijaan jatkaa elämäänsä, sillä henkilökunnasta poistuvien tilalle palkataan uutta väkeä. He jatkavat työtä, jolla aineistojen säilyvyys ja käytettävyys varmistetaan tietotekniikan muuttuessa. Tietoarkistokielellä kyse on aineistojen hoivaamisesta (curation).

Uudessa arkistointisopimuksessa tarjoamme mahdollisuuden asettaa jatkokäyttö luvanvaraiseksi vain määräajaksi. Tämä on erityisen hyvä ratkaisu tutkijoille, jotka haluavat ensin varmistua siitä, että tietoarkistossa osataan heidän aineistoansa hoivata. Tutkija voi suhtautua aineistoonsa kuin lapseen ja silloin on ymmärrettävää, että hän haluaa vakuuttua tietoarkiston käytännöistä ennen kuin antaa oikeuden toimittaa aineistoa käytettäväksi myös ilman hänen lupaansa.

Jos luvan kysymiselle ei ole olemassa vaihtoehtoista toimintatapaa, tulee aineistosta orpo, kun luvanantajaa ei enää tavoiteta. Aineistoa ei voi toimittaa jatkokäyttöön ja tietoarkiston toimintaperiaate on arkistoida aineistoja nimenomaan jatkokäyttöä varten. Orvoiksi muuttuvien aineistojen kohtalo täytyy punnita jokaisen aineiston kohdalla erikseen ja joskus päätös on se, että aineistoa ei enää hoivata. Se tarkoittaa sitä, että aineisto muuttuu ennen pitkää myös teknisesti käyttökelvottomaksi.

Vaikka me ihmiset elämme vain hetken, tietoarkisto varmistaa tutkimusaineistoille päättymättömän elinkaaren. Tänään ajankohtaiset aineistot soveltuvat kohta ajalliseen vertailuun ja aikanaan historian tutkimukseen. Pidetään siis aineistot elossa ja käyttökelpoisina ja varmistetaan, ettei niistä tule orpoja.

Katso myös usein kysytyt kysymykset arkistoinnista.

Arja Kuula
kehittämispäällikkö
etunimi.sukunimi [at] uta.fi

Orvot aineistot

Tietoarkisto on uusinut arkistointia koskevan sopimuksen ja aineistojen jatkokäyttöä koskevat käyttöehdot. Arkistointisopimuksessa halusimme erityisesti täsmentää tilanteita, joissa alkuperäinen tutkija edellyttää häneltä luvan kysymistä jokaiseen aineiston jatkokäyttöön.

Testasimme uuden sopimuksen ehtoja jo viime syksynä muutamien tutkijoiden kanssa. Osa hämmentyi pyynnöstä nimetä vaihtoehtoinen toimintatapa tai toinen henkilö, jolta lupaa aineiston käyttöön voi kysyä, jos aineiston arkistoitunutta henkilöä itseään ei tavoiteta. ”Ei kukaan muu voi antaa käyttöön lupaa, ei vain voi”, sanoi yksi tutkija. Lyhyen hiljaisuuden jälkeen hän itse totesi kuolevansa tietysti joskus.

Tutkijat ja tietoarkiston henkilökunta siirtyvät aikanaan eläkkeelle ja kuolevat. Toisinaan elämän kulkua muuttaa sairaus tai tapaturma. Tietoarkistoon arkistoitu aineisto sen sijaan jatkaa elämäänsä, sillä henkilökunnasta poistuvien tilalle palkataan uutta väkeä. He jatkavat työtä, jolla aineistojen säilyvyys ja käytettävyys varmistetaan tietotekniikan muuttuessa. Tietoarkistokielellä kyse on aineistojen hoivaamisesta (curation).

Uudessa arkistointisopimuksessa tarjoamme mahdollisuuden asettaa jatkokäyttö luvanvaraiseksi vain määräajaksi. Tämä on erityisen hyvä ratkaisu tutkijoille, jotka haluavat ensin varmistua siitä, että tietoarkistossa osataan heidän aineistoansa hoivata. Tutkija voi suhtautua aineistoonsa kuin lapseen ja silloin on ymmärrettävää, että hän haluaa vakuuttua tietoarkiston käytännöistä ennen kuin antaa oikeuden toimittaa aineistoa käytettäväksi myös ilman hänen lupaansa.

Jos luvan kysymiselle ei ole olemassa vaihtoehtoista toimintatapaa, tulee aineistosta orpo, kun luvanantajaa ei enää tavoiteta. Aineistoa ei voi toimittaa jatkokäyttöön ja tietoarkiston toimintaperiaate on arkistoida aineistoja nimenomaan jatkokäyttöä varten. Orvoiksi muuttuvien aineistojen kohtalo täytyy punnita jokaisen aineiston kohdalla erikseen ja joskus päätös on se, että aineistoa ei enää hoivata. Se tarkoittaa sitä, että aineisto muuttuu ennen pitkää myös teknisesti käyttökelvottomaksi.

Vaikka me ihmiset elämme vain hetken, tietoarkisto varmistaa tutkimusaineistoille päättymättömän elinkaaren. Tänään ajankohtaiset aineistot soveltuvat kohta ajalliseen vertailuun ja aikanaan historian tutkimukseen. Pidetään siis aineistot elossa ja käyttökelpoisina ja varmistetaan, ettei niistä tule orpoja.

Katso myös usein kysytyt kysymykset arkistoinnista.

Arja Kuula
kehittämispäällikkö
etunimi.sukunimi [at] uta.fi

Tekninen kehitys laajentaa tietoarkistojen toimintaa

Ensimmäiset yhteiskuntatieteelliset data-arkistot aloittivat toimintansa 1960-luvulla Yhdysvalloissa ja Euroopassa. Niiden syntyyn vaikutti keskeisesti tietokoneiden ja laajoihin surveyaineistoihin perustuvien tutkimusmenetelmien kehittyminen sekä näiden suosion nopea kasvu useilla ihmistieteellisillä aloilla. Data-arkistoja ryhdyttiin perustamaan myös kaupallisten mielipidetutkimuslaitosten yhteyteen erityisesti Yhdysvalloissa.

Data-arkistot toimivat kolme ensimmäistä vuosikymmentään ja osin vielä 1990-luvullakin keskustietokoneympäristöissä. Varsinkin tästä syystä niiden säilyttämien henkilötason tutkimusaineistojen käyttäjät olivat lähes yksinomaan tutkijoita. Sähköiset datatiedostot haettiin joko paikan päältä arkistoista tai ne kuljetettiin eri tallennevälineillä käyttäjilleen.

Kun itse tilasin 90-luvun alkupuolella Saksan yhteiskuntatieteellisestä data-arkistosta Kölnistä Eurobarometrien data-aineistoja, ne toimitettiin työhuoneeseeni Tampereelle postitse kelanauhoina. Sitten marssin tavaran kanssa yliopistomme tietokonekeskukseen, jossa tiedostot siirrettiin (maksutta) keskuskoneen käyttäjätunnukselleni. Tämän jälkeen vuorossa olivat ascii-muotoisten tiedostojen määrittelyt sellaiseen muotoon, että tilastollinen tietojenkäsittelyohjelma sai datasta tolkkua. Keskuskone oli sen verran ruuhkainen, että suurimmat tietokoneajot piti suosiolla ajoittaa suoritettavaksi illemmalla eikä työpäivän aikana.

Toisin on tänään. Vaikka en edes kuulu varhaiseen reikäkortti- ja lajittelijasukupolveen enkä ole siis värjötellyt tietojenkäsittelyn Siperiassa, olen silti todistanut mikrotietokoneiden ja Internetin vallankumouksen koko tähänastisen polun. Data-arkistoalalle teknologian nopea kehitys on tuonut useita muutoksia ja isoja haasteita. Aikaisemmin ala keskittyi data-aineistojen arkistointiin, pitkäaikaissäilytykseen ja jakeluun erityisesti tutkimuskäyttöä ajatellen. Kansainvälisessä yhteistyössä arkistot toimivat data-aineistojen välittäjinä tutkijoille siten, että kansalliset data-arkistot toimivat oman maansa tutkijoille ulkomaisten aineistojen välittäjinä.

Internet-sukupolvelle ajatus välikäsistä ja pitkistä toimitusajoista on vieras. Yhä useamman tutkijankin mielestä tutkimuksen tietoaineistojen tulisi olla ladattavissa suoraan omalle tietokoneelle luotettavista lähteistä heti ja lähtökohtaisesti myös maksutta. Lisäksi tietojen pitäisi olla vaivattomasti yhdisteltävissä muihin tietoihin ja niiden tulisi muutoinkin olla helppokäyttöisiä. Hyvä näin, sillä todellinen edistys edellyttää aina sitä, että joku vaatii muutosta. Näihin haasteisiin vastaaminen edellyttää toimivia palveluinfrastruktuureja.

Data-arkistoalalla teknologian kehitys on jo avartanut suunnattomasti tutkimusaineistojen käyttötapoja ja -mahdollisuuksia. Avoimet datatietokannat ovat lisänneet huomattavasti soveltuvien tutkimusaineistojen löytymistä ja saatavuutta. Joskus suunniteltu uusi tutkimusaineisto on jäänyt kokonaan keräämättä. Omassa toiminnassamme meitä on ilahduttanut erityisesti se, että perustutkinto-opiskelijat käyttävät tietoarkistoon arkistoituja aineistoja kasvavassa määrin omiin opinnäytetöihinsä.

Myös tietoaineistojen opetuskäytön erilaisia mahdollisuuksia tulisi oppia hyödyntämään täysipainoisesti. Data-projektori ja Internet opetustilassa mahdollistavat jo nyt eri aiheisiin liittyvien dataperustaisten online-palvelujen käytön kontaktiopetuksessa. Näin opetus perustuu ajantasaisimpaan tietoon.

Tietoarkisto on laajentamassa palvelujaan tähän suuntaan. Jo nyt muun muassa Menetelmäopetuksen tietovarannon harjoitusaineistot ovat vapaasti heti käytettävissä. Tavoitteena on myös uusia aineistojen toimitusjärjestelmä vuoden 2012 loppuun mennessä. Uudistuksen valmistuttua rekisteröityneet asiakkaat voivat hyödyntää tietoarkiston koko aineistovarantoa datatiedostoineen suoraan verkossa.

Sami Borg
johtaja
etunimi.sukunimi [at] uta.fi

Tekninen kehitys laajentaa tietoarkistojen toimintaa

Ensimmäiset yhteiskuntatieteelliset data-arkistot aloittivat toimintansa 1960-luvulla Yhdysvalloissa ja Euroopassa. Niiden syntyyn vaikutti keskeisesti tietokoneiden ja laajoihin surveyaineistoihin perustuvien tutkimusmenetelmien kehittyminen sekä näiden suosion nopea kasvu useilla ihmistieteellisillä aloilla. Data-arkistoja ryhdyttiin perustamaan myös kaupallisten mielipidetutkimuslaitosten yhteyteen erityisesti Yhdysvalloissa.

Data-arkistot toimivat kolme ensimmäistä vuosikymmentään ja osin vielä 1990-luvullakin keskustietokoneympäristöissä. Varsinkin tästä syystä niiden säilyttämien henkilötason tutkimusaineistojen käyttäjät olivat lähes yksinomaan tutkijoita. Sähköiset datatiedostot haettiin joko paikan päältä arkistoista tai ne kuljetettiin eri tallennevälineillä käyttäjilleen.

Kun itse tilasin 90-luvun alkupuolella Saksan yhteiskuntatieteellisestä data-arkistosta Kölnistä Eurobarometrien data-aineistoja, ne toimitettiin työhuoneeseeni Tampereelle postitse kelanauhoina. Sitten marssin tavaran kanssa yliopistomme tietokonekeskukseen, jossa tiedostot siirrettiin (maksutta) keskuskoneen käyttäjätunnukselleni. Tämän jälkeen vuorossa olivat ascii-muotoisten tiedostojen määrittelyt sellaiseen muotoon, että tilastollinen tietojenkäsittelyohjelma sai datasta tolkkua. Keskuskone oli sen verran ruuhkainen, että suurimmat tietokoneajot piti suosiolla ajoittaa suoritettavaksi illemmalla eikä työpäivän aikana.

Toisin on tänään. Vaikka en edes kuulu varhaiseen reikäkortti- ja lajittelijasukupolveen enkä ole siis värjötellyt tietojenkäsittelyn Siperiassa, olen silti todistanut mikrotietokoneiden ja Internetin vallankumouksen koko tähänastisen polun. Data-arkistoalalle teknologian nopea kehitys on tuonut useita muutoksia ja isoja haasteita. Aikaisemmin ala keskittyi data-aineistojen arkistointiin, pitkäaikaissäilytykseen ja jakeluun erityisesti tutkimuskäyttöä ajatellen. Kansainvälisessä yhteistyössä arkistot toimivat data-aineistojen välittäjinä tutkijoille siten, että kansalliset data-arkistot toimivat oman maansa tutkijoille ulkomaisten aineistojen välittäjinä.

Internet-sukupolvelle ajatus välikäsistä ja pitkistä toimitusajoista on vieras. Yhä useamman tutkijankin mielestä tutkimuksen tietoaineistojen tulisi olla ladattavissa suoraan omalle tietokoneelle luotettavista lähteistä heti ja lähtökohtaisesti myös maksutta. Lisäksi tietojen pitäisi olla vaivattomasti yhdisteltävissä muihin tietoihin ja niiden tulisi muutoinkin olla helppokäyttöisiä. Hyvä näin, sillä todellinen edistys edellyttää aina sitä, että joku vaatii muutosta. Näihin haasteisiin vastaaminen edellyttää toimivia palveluinfrastruktuureja.

Data-arkistoalalla teknologian kehitys on jo avartanut suunnattomasti tutkimusaineistojen käyttötapoja ja -mahdollisuuksia. Avoimet datatietokannat ovat lisänneet huomattavasti soveltuvien tutkimusaineistojen löytymistä ja saatavuutta. Joskus suunniteltu uusi tutkimusaineisto on jäänyt kokonaan keräämättä. Omassa toiminnassamme meitä on ilahduttanut erityisesti se, että perustutkinto-opiskelijat käyttävät tietoarkistoon arkistoituja aineistoja kasvavassa määrin omiin opinnäytetöihinsä.

Myös tietoaineistojen opetuskäytön erilaisia mahdollisuuksia tulisi oppia hyödyntämään täysipainoisesti. Data-projektori ja Internet opetustilassa mahdollistavat jo nyt eri aiheisiin liittyvien dataperustaisten online-palvelujen käytön kontaktiopetuksessa. Näin opetus perustuu ajantasaisimpaan tietoon.

Tietoarkisto on laajentamassa palvelujaan tähän suuntaan. Jo nyt muun muassa Menetelmäopetuksen tietovarannon harjoitusaineistot ovat vapaasti heti käytettävissä. Tavoitteena on myös uusia aineistojen toimitusjärjestelmä vuoden 2012 loppuun mennessä. Uudistuksen valmistuttua rekisteröityneet asiakkaat voivat hyödyntää tietoarkiston koko aineistovarantoa datatiedostoineen suoraan verkossa.

Sami Borg
johtaja
etunimi.sukunimi [at] uta.fi