Užsiregistruoti

Duomenų ir dirbtinio intelekto poveikis mokslinei produkcijai

Politinė perspektyva, kaip FAIR duomenys ir dirbtinio intelekto valdymas gali padėti išlaikyti mokslinės produkcijos patikimumą.

Autoriai:

Barendo kalno portretas

Barendas monsLeideno universiteto emeritas profesorius, GO FAIR fondo valdybos narys ir LIFES, Leideno iniciatyvos, skirtos FAIR ir „Equitable science“, direktorius

Arie Baak portretinė nuotrauka

Arie Baak, LIFES asociacijos, skirtos FAIR ir Equitable mokslui, valdybos narys

Koeno Jonkerso portretas

Koen Jonkers, Europos Komisija, Jungtinis tyrimų centras (JRC), Briuselis, Belgija

Dirbtinis intelektas keičia mokslo vykdymo, komunikacijos ir patvirtinimo būdus. Jis turi realių galimybių, nes leidžia atpažinti šablonus tokiu mastu, kokio negali pasiekti joks žmogus tyrėjas, spartina darbo eigą ir atveria naujas atradimų galimybes. Tačiau dirbtinis intelektas taip pat yra greitas, ne be klaidų ir nekritiškas, o mokslas reikalauja daug laiko ir yra kruopštus. Įtampa tarp šių dviejų realybių jau sukelia rimtų sutrikimų: dirbtinio intelekto sugeneruotų publikacijų ir duomenų potvynį, prastą kolegų vertinimą, haliucinacines išvadas ir mažėjantį pasitikėjimą moksliniais įrašais. Būsimiems mokslininkams reikalingi įgūdžiai iš esmės keičiasi, o mokslo politika neatsilieka. Šią spragą reikia nedelsiant pašalinti.

Dirbtinis intelektas keičia mokslo veikimo būdus

Mokslas iš duomenų stokos aplinkos nepaprastai greitai perėjo prie duomenimis turtingos aplinkos. Anksčiau tyrėjai generuodavo kuklius duomenų rinkinius ir savo išvadas perteikdavo daugiausia žmonėms suprantamais straipsniais, o dabar veikia eksponentinio duomenų generavimo eroje. Didžioji dalis duomenų yra daugiamačiai, paskirstyti ir apdorojami tik mašinomis. Tačiau ši tendencija neatsispindi faktiniame duomenų pakartotiniame naudojime. Norint tai pakeisti, patys duomenys dabar turi būti traktuojami kaip aukščiausios klasės mokslinis produktas, o ne straipsnių šalutinis produktas.

Mašinos puikiai geba rasti dėsningumus dideliuose ir sudėtinguose duomenų rinkiniuose. Tačiau jos neturi jokio būdingo žmogui aktualios realybės konceptualaus modelio. Rezultatas – beveik neribotas dėsningumų kiekis, daugelis jų netikri, kai kurie – klaidinantys. Pagrindinis iššūkis kitai mokslininkų kartai bus naršyti šiuose dėsningumų džiunglėse: atskirti reikšmingą signalą nuo statistinio triukšmo. Žmogaus priežiūra nėra neprivaloma; ji yra struktūriškai būtina.

Politikos formuotojai taip pat turėtų žinoti, kad dirbtinis intelektas moksle apima daug daugiau nei didžiųjų kalbų modelius, kurie šiuo metu dominuoja viešajame diskurse. Platesnė sritis apima mašininį mokymąsi hipotezių generavimui, automatizuotus eksperimentinius darbo eigą ir žinių grafais pagrįstą samprotavimą, kurių kiekvienas kelia skirtingą riziką ir galimybes, kurioms reikia pritaikytų valdymo atsakų.

Duomenų kokybė ir infrastruktūra yra kliūtis

Mokslo srities dirbtinio intelekto rezultatų kokybė tiesiogiai priklauso nuo duomenų kokybės. indėlisFAIR duomenys (angl. Findable, Accessible, Interoperable and Reusable, and which was always an Fully AI Ready) yra pagrindinė atsakingo DI paremto mokslo sąlyga. Be jų DI modeliai yra apmokomi naudojant neapdorotą, nekuruotą, potencialiai šališką ar net sufabrikuotą turinį, sukeldami haliucinacijas, kurios klinikiniuose kontekstuose gali būti pavojingos gyvybei ir sistemingai kenkia pasitikėjimui mokslu. Ypač tais atvejais, kai lengvai randamus duomenis pakartotinai naudoja daugiausia ne mokslu paremti veikėjai, pavyzdžiui, dabartinės teisės magistro (LLM) įmonės.

Lygiai taip pat svarbu naudoti FAIR konceptualius modelius dirbtiniam intelektui apriboti. išėjimaiPateikdami struktūrizuotus semantinius karkasus, kuriuose kiekviena sąvoka yra aiškiai apibrėžta, kaip jos susijusios ir kas laikoma pagrįsta išvada, šie modeliai žymiai sumažina haliucinacijų riziką ir padeda užtikrinti, kad dirbtinio intelekto generuojami rezultatai išliktų paaiškinami, interpretuojami ir patikrinami žmonių.

Mokslinių leidinių sąžiningumo krizė dar labiau padidina šią riziką. Dirbtinio intelekto sistemos dabar gali beveik akimirksniu generuoti įtikinamai atrodančius straipsnius, duomenis ir apžvalgas. Vien 2025 m. vienoje pirmaujančioje dirbtinio intelekto konferencijoje buvo pateikta daugiau nei 20 000 paraiškų. Toks atsakas (mokslininkai, naudodami dirbtinį intelektą dirbtinio intelekto sukurtiems straipsniams peržiūrėti) kelia grėsmę sukurti uždarą grįžtamojo ryšio ciklą, kuriame ydingos sistemos vertina viena kitą be prasmingo išorinio patikrinimo. Šaltinyje skelbiami FAIR duomenys, kurių kilmę galima patikrinti, yra viena patikimiausių priemonių šiai tendencijai kovoti.

Viso to pagrindas – struktūrinis skatinimo sistemos trūkumas. Tyrėjai vis dar daugiausia apdovanojami už straipsnių skaičių ir citavimo rodiklius – rodiklius, sukurtus duomenų stokos erai. Aukštos kokybės FAIR duomenų publikavimas nesuteikia didelio profesinio pripažinimo ir negarantuoja finansavimo. Tai turi pasikeisti.

Valdymo spragos yra opios

Mokslo duomenų techninio valdymo aplinka išgyvena krizę. Dešimtmečius trukusi priklausomybė nuo nedidelio skaičiaus didelių debesijos paslaugų teikėjų kartu su tokiais teisiniais dokumentais kaip JAV Debesijos įstatymas sukūrė duomenų suvereniteto problemą, kuri dabar yra opi, ypač atsižvelgiant į pastaruoju metu JAV politikos nestabilumą ir jo poveikį tarptautiniu mastu bendrai mokslinių tyrimų infrastruktūrai. Daugelis pagrindinių pasaulio mokslinių duomenų išteklių iš esmės nepatenka į juos sukūrusių institucijų ir bendruomenių jurisdikcijos kontrolę.

FAIR principai, papildyti CARE principais (kuriais sprendžiami čiabuvių tautų teisių ir interesų duomenų valdymo klausimais), suteikia nuoseklią atsakingo valdymo sistemą. Kartu jie apibrėžia sąlygas, kuriomis duomenys turėtų būti atviri arba ribojami, pakartotinai naudojami ir suverenūs. FAIR duomenų ir paslaugų interneto (IFDS) koncepcija, kai duomenys lieka savo šaltinyje ir juos lanko įgalioti algoritmai, o ne kopijuojami ir centralizuoti, siūlo praktišką architektūrinį atsakymą. Šiame modelyje skaičiavimo užklausos keliauja į paskirstytus duomenų mazgus; duomenys nekeliauja į centralizuotas saugyklas, nebent tai neišvengiama.

Norint teisingai dalyvauti dirbtiniu intelektu paremtame moksle, taip pat reikia, kad ši infrastruktūra būtų tikrai prieinama. Pietų pusrutulio institucijos ir bendruomenės negali būti pasyvūs duomenų pakartotinio naudojimo subjektai. Kitame jungiamumo spektro gale neturėtų būti atmesta daug duomenų naudojanti pramonė. Paskirstyta FAIR infrastruktūra, sukurta siekiant išvengti priklausomybės nuo tiekėjų ir pavienių gedimo taškų, yra mechanizmas, kuriuo prasmingas dalyvavimas tampa įmanomas.

Ką turėtų daryti politikos formuotojai

Nuosekliam politiniam atsakui reikia veiksmų keliose srityse:

  • Reikalauti FAIR duomenų standartų viešai finansuojamuose tyrimuose. Finansavimo įstaigos turėtų nustatyti, kad FAIR duomenų publikavimas būtų dotacijų skyrimo sąlyga, o ne rekomendacija.
  • Duomenų publikavimą ir FAIRificavimą finansuoti kaip tinkamas dotacijų išlaidas. Turi būti pripažintos ir padengtos investicijos, reikalingos aukštos kokybės, mašinomis apdorojamiems duomenims generuoti.
  • Dotacijų paraiškose pakartotinai panaudoti anksčiau sugeneruotus duomenis ir pagalbinės infrastruktūros tinkamas mokslinių tyrimų išlaidasTuri būti pripažintos ir padengtos investicijos, reikalingos aukštos kokybės, mašinomis apdorojamiems duomenims saugoti ir teikti.
  • Remkite bendruomenės pagrindu sukurtus standartus, o ne tiekėjų siūlomus sprendimus. Atvira, sąveiki infrastruktūra, sukurta remiantis minimaliais bendrais standartais, užkerta kelią susaistymui ir užtikrina lygias sąlygas.
  • Investuokite į mokslinį raštingumą. Be mokslininkų, piliečiams, žurnalistams ir politikos formuotojams taip pat reikia gerai suprasti dirbtinio intelekto galimybes ir apribojimus. Atotrūkis tarp visuomenės suvokimo ir techninės realybės yra valdymo rizika.
  • Įgalioti dirbtinio intelekto, naudojamo moksliniuose tyrimuose, kilmės ir skaidrumo reikalavimai. Bet kuri dirbtinio intelekto sistema, prisidedanti prie paskelbtų mokslinių išvadų, turėtų būti įpareigota atskleisti mokymo duomenų kilmę, modelio apribojimus ir apribojimus.

Mokslas yra pasaulinė viešoji gėrybė. Jo vientisumo, teisingumo ir atvirumo negalima daryti prielaidų; tam reikalingi aktyvūs politiniai pasirinkimai. Galimybė užtikrinti patikimą dirbtinio intelekto valdymą mokslinėje produkcijoje yra atvira, tačiau ji tokia nebus amžinai. Dabar priimti sprendimai dėl duomenų standartų, infrastruktūros, paskatų ir priežiūros nulems, ar dirbtinis intelektas paspartins patikimo mokslo plėtrą, ar sistemingai jam kenks.


„Getty Images“ nuotr. Unsplash+

Šis tinklaraštis, sukurtas bendradarbiaujant Tarptautinei mokslo tarybai (ISC) ir „Frontiers Policy Labs“, yra dalis „Naujas mokslo valdymas XXI amžiuje“" serija, tarnaujanti kaip dinamiškas diskusijų forumas minties lyderiams apie mokslo valdymo ateitį. Atsisakant griežtų akademinių tyrimų, iniciatyva suburia pirmaujančius pasaulio balsus, kad jie pateiktų aštrias, provokuojančias, bet įrodymais pagrįstas ir į ateitį orientuotas nuomones. Taip siekiama prisidėti prie atsparaus, įtraukaus ir skaidraus valdymo modelio, pasirengusio ateities iššūkiams, apibrėžimo.

Žiūrėkite originalų įrašą čia.

Atsakomybės neigimas
Mūsų svečių tinklaraščiuose pateikta informacija, nuomonės ir rekomendacijos yra atskirų autorių nuomonės ir nebūtinai atspindi Tarptautinės mokslo tarybos vertybes ir įsitikinimus.

Sekite mūsų naujienlaiškius