
Tietokoneen näytöllä vilkkuva kielimalli juttelee mukavia.
”Hei ja kiitos kysymyksestä! Olen iloinen, kun voin auttaa sinua tehtävässäsi. Hyvää päivänjatkoa”, sanat ilmestyvät ruudulle.
Se vastaa kysymyksiin ihmisen kielellä ja käyttää sanoja, joiden tarkoitus on välittää merkityksiä. Arkikielessä sitä kutsutaan tekoälyksi, mutta nimi johtaa harhaan.
Tekoäly ei ole älykäs. Se ei ajattele. Kun kielimalli tuottaa sanoja, se ei lisää niihin itse minkäänlaisia merkityksiä. Mutta laskea se osaa.
Mallin kouluttaminen on aloitettu keräämällä kasaan miljardeja sanoja käsittävä aineisto. Sanat on pilkottu mahdollisimman pieniksi osasiksi: yksittäisiksi tavuiksi, jopa kirjaimiksi.
Sitten supertehokkaat tietokoneet alkavat pilkkoa sanaston osasten suhdetta toisiinsa. Kuukausien ajan ne laskevat kirjaimia ja todennäköisyyksiä.
Kielimallille ei opeteta, mikä on vokaali tai konsonantti. Silti se oppii laskemaan, kuinka luultavasti suomenkielisessä sanassa vokaali seuraa vokaalia, tai a-kirjain seuraa t-kirjainta tai että sana loppuu konsonanttiin.
”Kyseessä on tietokoneohjelma, joka on rakennettu tuottamaan tekstiä. Tekstiä tuottamalla se pystyy suorittamaan myös sille annettuja tehtäviä.” Hannu Toivonen
Rakenteeltaan kielimalli on verkosto, jonka eri osat ovat suhteessa toisiinsa. Verkkojen rakenne vaikuttaa siihen, millaisia yhteyksiä tietokoneet voivat aineiston avulla tehdä. Näiden neuroverkkojen esikuvana on käytetty ihmisaivoja ja sen sisäisiä yhteyksiä.
Sitten kun kaikki laskutoimitukset on lopulta suoritettu, kielimalli on valmis. Se voi tehdä, mitä siltä pyydetään. Se laskee neuroverkon solmukohdissa todennäköisyyksiä ja tuottaa sanoja tai kuvia.
Samaan tapaan, kuin kännykän automaattinen tekstinsyöttö.
”Kyseessä on tietokoneohjelma, joka on rakennettu tuottamaan tekstiä. Tekstiä tuottamalla se pystyy suorittamaan myös sille annettuja tehtäviä”, Helsingin yliopiston tietojenkäsittelytieteen professori Hannu Toivonen kertoo.
Tekstiä ja kuvia tuottavat tekoälyt on otettu suurieleisesti käyttöön aivan viime vuosina. Samantapaisia laskentamalleja käyttävät tietokoneohjelmistot ovat kuitenkin olleen jo pitkään kaikkien saatavilla.
Automaattisen tekstinsyötön tai internetin käännösohjelmat voi hyvin laskea tekoälyiksi.
Helsingin yliopiston yhteiskuntadatatieteen keskuksen professorin Krista Laguksen mukaan kielimallien tieteelliset läpimurrot on tehty viimeisen vuosikymmenen aikana.
”Esimerkiksi Chat GPT:tä on visioitu ainakin kolmekymmentä vuotta ja yritetty rakentaa yhtä kauan. Läpimurto on nyt saavutettu, mutta sellaisen näkemisessä voi kestää kauan.”
Tekoälymallien taustalla olevat algoritmit eli tietokoneiden laskentamallit ovat matemaatikkojen alaa. Laskutapojen kehittäminen on hidasta, mutta matematiikka ei ole ainoa pullonkaula tekoälyjen kehityksessä.
”Esimerkiksi ChatGPT:tä on visioitu ainakin kolmekymmentä vuotta ja yritetty rakentaa yhtä kauan. Läpimurto on nyt saavutettu, mutta sellaisen näkemisessä voi kestää kauan.” Krista Lagus
Koneoppimiseen tarvitaan myös valtavasti dataa. Eli valokuvia, tekstiä, puhetta tai videoita. Kaikkea sitä, mitä internet on tulvinut sosiaalisen median läpimurron jälkeen.
”Nykyisenlaisia tekoälymalleja ei voisi olla olemassa ilman sosiaalista mediaa”, Krista Lagus sanoo.
Kasvojentunnistukseen käytettävien tekoälymallien kehitykselle on ollut ratkaisevaa, että sosiaalisessa mediassa on tarjolla loputon määrä erinäköisten ihmisten kuvia vuosien varrelta.
Laguksen mukaan tekoälyn tulevaa kehitystä voi arvioida ennakolta muun muassa sen perusteella, mihin syntyy toistaiseksi hyödyntämätöntä dataa. Tällä hetkellä data-aarre on terveydenhuollossa ja hyvinvointibisneksessä.
Sairaanhoitoa varten koulutetaan jo erilaisia koneoppimisen malleja, muun muassa syöpien tai silmäsairauksien tunnistamiseen.
Tällaisten mallien kehitysvauhti kiihtyisi huimasti, jos kaikkien terveystiedot avattaisiin koneoppimisen käyttöön. Terveysdata on kuitenkin tiukasti säänneltyä, ja hyvästä syystä.
Ilman sääntelyä esimerkiksi älysormuksen valmistaja voisi kirjata laitteen käyttöehtoihin oikeuden myydä käyttäjädataa. Silloin moni saattaisi tahtomattaan luopua hyvin henkilökohtaisista tiedoista, kuten unen laadusta tai vessakäyntien määrästä.
”Minä tai tieteenalani yleensäkään ei kannata kaiken medikaalisen datan hyödyntämistä koneoppimisessa. Tällaisen datan käyttöön pitäisi suhtautua suurella varovaisuudella ja viisaudella”, Lagus sanoo.
Nykyisetkin kielimallit alkavat silti lähitulevaisuudessa vaikuttaa työelämään ja yhteiskuntaan. Laguksen mukaan työ, jossa käsitellään tietoa, tulee muuttumaan muita nopeammin.
Kuvitteellinen esimerkki: Hallinnossa työskentelee etuuskäsittelijöiksi kutsuttuja ihmisiä. Heidän työtään on arvioida, onko tuen hakija oikeutettu tuen saantiin. Etuuskäsittelijän on ymmärrettävä järjestelmän koukeroita, mutta työssä on myös paljon kaavamaisuutta.
Suuri osa tällaisesta hakemusten arvioinnista ja käsittelystä voisi muuttua nopeastikin tekoälyavusteiseksi.
Hakemuksia käsittelevä Etuusbotti-tekoäly koulutettaisiin esimerkiksi sadoilla miljoonilla henkilötiedoista putsatuilla tukihakemuksilla. Koulutusmateriaalin seasta tietokoneen laskentamalli erottaisi kaavoja, jotka toistuvat hyväksytyissä tai hylätyissä hakemuksissa.
Kun uusi hakemus saapuisi, algoritmi prosessoisi hetkessä, voiko tukea myöntää, tarvitaanko lisäselvityksiä ja niin edelleen.
Hakemuksia käsittelevä Etuusbotti-tekoäly koulutettaisiin esimerkiksi sadoilla miljoonilla henkilötiedoista putsatuilla tukihakemuksilla.
Mutta vaikka hakemusten läpikäynnin ja arvioinnin voisi kokonaankin automatisoida, hallinnon päätöksiä ei voi siirtää vain koneiden vastuulle.
”Se olisi todella dystooppista. Tekoälystä tiedetään valmiiksi, että ne tekevät virheitä ja toistavat vinoumia”, Krista Lagus sanoo.
Algoritmien tiedetään esimerkiksi uusintavan ihmisten ennakkoasenteita. Etuuksia käsittelevä tekoäly saattaisi kuin itsestään suosia kirjakielellä laadittuja hakemuksia ja syrjiä puhekielisiä.
Tekoälyyn sisältyy auttamatta yhteiskunnan asenteiden painolastia. Siksi niiden tuotoksia ei tule ajatella neutraaleina.
Ja Etuusbotin tapauksessa lopullisen tukipäätöksen pitäisi aina olla ihmisen tekemä.