Hyppää sisältöön

Kun puheesta tulee käyttöliittymä

Lukuaika noin 9 minuuttia

Kun puheesta tulee käyttöliittymä

Puheentunnistuksen tärkein kehitysaskel ei ole enää sanojen tarkempi tunnistaminen. Todellinen muutos alkaa, kun järjestelmä ymmärtää käyttäjän tavoitteen ja pystyy muuttamaan puheen oikeaksi tiedoksi ja toiminnaksi osana työtä.

Perinteinen graafinen käyttöliittymä, kuten ohjelma tietokoneella, on erinomainen silloin, kun käyttäjä voi pysähtyä, katsoa näyttöä ja etsiä oikean valikon tai painikkeen. Monessa työssä aikaa pysähtymiseen ei kuitenkaan ole.

Hoitajan huomio on asukkaassa. Huoltoteknikon kädet ovat laitteessa. Kuljettajan katse on tiessä. Varastotyöntekijän kädet ovat täynnä tavaraa. Näissä tilanteissa järjestelmän käyttäminen voi tarkoittaa varsinaisen työn keskeyttämistä vain siksi, että tietoa pitää syöttää tai hakea. Puhe voi muuttaa tätä.

Parhaimmillaan puhekäyttöliittymän ansiosta käyttäjän ei enää tarvitse mukauttaa toimintaansa järjestelmän rakenteeseen. Hän voi yksinkertaisesti kertoa, mitä on tekemässä, ja järjestelmän tehtäväksi jää ymmärtää, mitä tämä tarkoittaa.

Puhe ei ole vain uusi näppäimistö

Perinteinen sanelu ratkaisee melko tarkasti rajatun ongelman: se muuttaa puheen tekstiksi. Älykäs puhekäyttöliittymä tekee enemmän: se pyrkii ymmärtämään käyttäjän tavoitteen, hyödyntämään tilanteen kannalta olennaista kontekstia, kysymään tarvittaessa tarkennuksen ja viemään tiedon oikeaan paikkaan tai käynnistämään oikean toimenpiteen.

Ero on olennainen. Jos käyttäjä sanoo järjestelmälle, että asukkaan verenpaine mitattiin aamulla ja kertoo mittaustuloksen, hyödyllisin lopputulos ei ole litteroitu lause. Sen sijaan se voi olla, että oikea mittaus tallentuu oikealle henkilölle, oikeaan rakenteiseen kenttään, oikealla aikaleimalla – ja käyttäjä pystyy vielä tarkistamaan kriittisen tiedon ennen tallennusta.

Puheen kehitystä kannattaakin ajatella ketjuna:

puhe → aikomus → jäsennelty tieto → toiminto

Puheen varsinainen arvo syntyy vasta, kun se liittyy todelliseen työnkulkuun.

Mitä tapahtuu, kun käyttöliittymä siirtyy lähemmäs itse työtä?

Hoiva on tästä kiinnostava esimerkki. Työterveyslaitoksen vuonna 2026 julkaisemassa Tekoälyratkaisut hoivassa -tutkimuksessa tarkasteltiin Moivan tekoälyavusteista puhekirjaamista kolmessa Attendon hoivakodissa. Tutkimuksessa yhdistettiin järjestelmätietoja, havainnointia ja haastatteluja. Yhdessä tutkimuskohteena olleessa hoivakodissa päivittäisiin hoivatoimiin liittyvään kirjaamiseen käytetyn ajan arvioitiin puolittuneen noin 46 minuutista 21 minuuttiin työntekijää kohden arkipäivänä.

Minuuttimäärää kiinnostavampi havainto liittyy kuitenkin siihen, miten työ muuttui. Kirjaaminen ei enää kasaantunut samalla tavalla vuoron loppuun, vaan jakautui tasaisemmin työpäivälle. Hoitajat kuvasivat, että asioita voitiin kirjata silloin, kun ne olivat vielä tuoreessa muistissa. Samalla väheni tarve pitää päivän tapahtumia mielessä myöhempää kirjaamista varten. Tutkimuksessa tätä kuvataan muistikuorman helpottumisena, ja työntekijät kokivat, että aikaa vapautui asukkaiden kohtaamiseen ja aktiviteetteihin.

Tämä on hyvä esimerkki siitä, miksi käyttöliittymää ei kannata tarkastella irrallaan työstä. Puhekirjaamisen hyödyt hoivatyössä eivät syntyneet siitä, että sama teksti tuotettiin toisella tavalla. Hyöty syntyi siitä, että itse työn rytmi ja tapa toimia muuttuivat.

Missä puheesta syntyy eniten arvoa?

Puhekäyttöliittymiä ei kannata arvioida toimiala kerrallaan. Parempi lähtökohta on tarkastella yksittäistä työtilannetta: sama organisaatio voi hyötyä puheesta erittäin paljon yhdessä prosessissa ja hyvin vähän toisessa.

Neljä kysymystä auttaa tunnistamaan hyviä käyttökohteita:

1. Kuinka usein tehtävä toistuu?

Puheesta syntyvä hyöty kertautuu, kun sama digitaalinen tehtävä toistuu jatkuvasti. Kirjaaminen, tehtävän kuittaaminen, mittaustuloksen tallentaminen tai tiedon hakeminen voivat yksittäin olla pieniä työvaiheita. Jos työntekijä tekee niitä kymmeniä kertoja päivässä, niiden ympärille syntyvä kitka ei enää ole pieni.

Erityisen kiinnostavia ovat tällaiset mikrotehtävät: työntekijän täytyy hetkeksi keskeyttää varsinainen työnsä vain kommunikoidakseen järjestelmän kanssa. Jos tämän keskeytyksen voi poistaa, hyöty voi olla paljon suurempi kuin yhden käyttöliittymätoiminnon nopeutuminen.

2. Onko tehtävä rajattu vai avoin?

”Kirjaa verenpaine 130/80” on aivan erilainen ongelma kuin avoin asiakaspalvelukeskustelu. Mitä rajatumpi tehtävä on, sitä paremmin järjestelmän toimintaa voidaan yleensä kontrolloida ja validoida.

Avoimessa keskustelussa järjestelmän pitää ymmärtää paljon laajempi joukko käyttäjän mahdollisia tavoitteita, ylläpitää keskustelun kontekstia ja käsitellä epävarmuutta. Siksi ensimmäiset helposti mitattavat hyödyt löytyvät usein juuri rajatuista, usein toistuvista työvaiheista. Niissä tiedetään melko hyvin, mitä käyttäjä yrittää tehdä ja miltä onnistunut lopputulos näyttää.

3. Sopiiko ympäristö puheelle?

Puhe ei ole automaattisesti hyvä käyttöliittymä vain siksi, että teknologia pystyy tunnistamaan sen. Työympäristö ratkaisee paljon: Tuotantohallissa on melua. Hoivaosastolla ihmiset puhuvat samassa tilassa. Ajoneuvossa kuuluvat tie ja tuuli. Asiakasympäristössä ympärillä voi olla muista ihmisistä aiheutuvaa hälinää.

Lisäksi puheella on ominaisuus, jota näppäimistöllä ei ole: muut voivat kuulla sen. Tämä on erityisen tärkeää terveys-, asiakas- ja henkilötietojen yhteydessä. Työterveyslaitoksen tutkimuksessakin työntekijät kuvasivat tilanteita, joissa reaaliaikainen puhekirjaaminen ei ollut asukkaan näkökulmasta tarkoituksenmukaista: arkaluonteisten asioiden ääneen sanominen saattoi olla epäluontevaa tai jopa heikentää vuorovaikutusta.

Hyvä järjestelmä ei siksi vaadi puhetta jokaisessa tilanteessa, vaan sen pitää jättää ihmiselle harkintavalta.

4. Mitä virhe maksaa?

Tämä on ehkä tärkein kysymys. Jos järjestelmä hakee väärän tuotetiedon, käyttäjä voi tehdä uuden haun. Jos järjestelmä tallentaa väärän lääkeannoksen, mittausarvon tai henkilötunnisteen tuotantojärjestelmään, seuraukset ovat aivan toisenlaiset. Siksi kaikkia virheitä ei pidä käsitellä samanarvoisina.

Kriittisten tietojen kohdalla järjestelmän pitää pystyä pysähtymään ja varmistamaan käyttäjältä, mitä tämä tarkoitti. Hyvä puhekäyttöliittymä ei ole se, joka arvaa itsevarmimmin. Hyvä puhekäyttöliittymä tietää, milloin sen pitää kysyä.

Vaikein ongelma ei enää ole puheentunnistus

Puheentunnistus on ottanut viime vuosina valtavia harppauksia. Samalla varsinainen ongelma on siirtynyt eteenpäin.

Jos järjestelmä tunnistaa sanat lähes oikein, mutta käynnistää väärän toiminnon, käyttökokemus epäonnistuu. Jos se tunnistaa puheen hyvin, mutta vastaa käyttäjän taukoon liian nopeasti ja keskeyttää tämän, keskustelu tuntuu kömpelöltä. Jos se tulkitsee käyttäjän tavoitteen oikein, mutta kestää useita sekunteja ennen kuin mitään tapahtuu, vuorovaikutus tuntuu hitaalta.

Siksi puhekäyttöliittymän laatua ei kannata mitata vain sillä, kuinka tarkasti puhe muuttuu tekstiksi. Perinteinen word error rate eli puheentunnistuksen sanavirhetaso on edelleen hyödyllinen tekninen mittari, mutta käyttäjän kannalta olennaisempia kysymyksiä ovat:

  • Onnistuiko tehtävä?
  • Päätyikö oikea tieto oikeaan paikkaan?
  • Kuinka monta kertaa käyttäjän piti korjata järjestelmää?
  • Kuinka kauan koko tehtävän tekeminen kesti?
  • Ennen kaikkea: olivatko kriittiset tiedot oikein?

Kuten aiemmin todettiin, puhekäyttöliittymän tavoite monessa ammattikäytössä ei ole oikein litteroitu puhe. Tavoite on oikea järjestelmätila, toteutunut työnkulku ja onnistunut tehtävä.

Luottamus ennen ihmismäisyyttä

Tekoälypohjaisen puheteknologian kehityksessä kiinnitetään paljon huomiota luonnollisuuteen. Se on ymmärrettävää, sillä viiveet, oudot tauot ja robottimainen ääni tekevät keskustelusta nopeasti raskasta. Ammattikäytössä luonnollisuus ei kuitenkaan ole tärkein ominaisuus: luottamus on.

Täysin luonnolliselta kuulostava järjestelmä voi myös esittää väärän tiedon täysin vakuuttavasti. Vakuuttavasti lausuttu väärä numero on vaarallisempi kuin hieman kömpelö järjestelmä, joka sanoo: ”Varmistan vielä – sanoitko 130/80?”

Sama koskee toimintoja. Tiedon hakeminen ja tiedon kirjoittaminen järjestelmään eivät ole riskiltään samanlaisia. Haun voi yleensä uusia, mutta järjestelmään tallennettu väärä tieto voi jäädä vaikuttamaan pitkään. Siksi älykkään käyttöliittymän pitää ymmärtää muutakin kuin käyttäjän puhe: sen pitää ymmärtää myös toimenpiteen riski.

Tekoäly ei poista ammatillista harkintaa

Generatiivisen tekoälyn ympärillä käydyssä keskustelussa syntyy helposti kuva siitä, että mitä enemmän järjestelmä pystyy automatisoimaan, sitä parempi. Todellisessa työssä näin ei välttämättä ole.

Työterveyslaitoksen tutkimuksessa hoitajat tarkistivat tekoälyn muodostaman kirjausehdotuksen ja vastasivat edelleen itse kirjauksen oikeellisuudesta. Tutkijat korostavat, että puhekirjaaminen ei poista ihmistyötä, vaan muuttaa sen luonnetta: kirjoittamisen sijaan mukaan tulee puhumista, lukemista, arviointia ja tarvittaessa korjaamista.

Tämä on tärkeä havainto hoiva-alaa laajemmin. Tekoälyn tehtävä ei ole välttämättä tehdä työstä mahdollisimman automaattista, vaan sen pitäisi tehdä työnjaosta ihmisen ja järjestelmän välillä parempaa. Ihmisen pitäisi käyttää aikaansa siihen, missä hänen asiantuntijuutta tarvitaan eli missä hänen harkintansa, tilannetajunsa ja vastuunsa ovat olennaisia. Järjestelmän pitäisi poistaa tarpeetonta kitkaa sen ympäriltä.

Käyttöliittymä yksinkertaistuu, tausta monimutkaistuu

Käyttäjälle hyvä puhekäyttöliittymä voi näyttää hyvin yksinkertaiselta: Hän puhuu, järjestelmä ymmärtää, asia tapahtuu. Taustalla arkkitehtuuri voi olla aivan muuta.

Puhe voidaan tunnistaa erillisellä mallilla, käyttäjän tavoite tulkita toisella mallilla, tiedot tarkistaa sääntöpohjaisesti, järjestelmätoiminnot tehdä erillisillä työkaluilla ja lopputulos vielä validoida ennen tallennusta. Toisaalta uudet multimodaaliset mallit voivat käsitellä puhetta suoraan ja tehdä keskustelusta entistä luonnollisempaa. Todennäköisesti käytännön järjestelmät käyttävät jatkossa yhä useammin näiden yhdistelmiä.

Käyttäjälle näkyvä vuorovaikutus muuttuu luonnollisemmaksi samalla, kun kriittinen työ tehdään taustalla hallituissa kerroksissa. Tämä on kiinnostava paradoksi:

mitä yksinkertaisemmalta käyttöliittymä näyttää käyttäjälle, sitä enemmän järjestelmän täytyy ymmärtää taustalla.

Puhe ei korvaa näyttöä

Puheesta ei myöskään ole tulossa kaiken korvaavaa käyttöliittymää. Monessa tilanteessa paras ratkaisu on multimodaalinen: käyttäjä kertoo puheella tavoitteensa, järjestelmä hakee tai tuottaa tarvittavan tiedon, kriittiset yksityiskohdat tarkistetaan näytöltä, ja tarvittaessa kamera, sensorit tai järjestelmän nykyinen tila tuovat keskusteluun lisää kontekstia.

Olennaista ei ole valita voittajaa puheen ja graafisen käyttöliittymän välillä. Ne ovat vain välineitä, joiden avulla voimme päästä haluttuun lopputulokseen. Paljon olennaisempaa on valita kuhunkin työvaiheeseen luontevin tapa toimia.

Järjestelmän pitäisi mukautua työhön

Puhekäyttöliittymien kehitys on yksi esimerkki paljon laajemmasta muutoksesta. Tietojärjestelmiä on pitkään rakennettu niin, että käyttäjän pitää ymmärtää ainakin osittain järjestelmän logiikkaa: Missä tieto sijaitsee? Minkä valikon takana toiminto on? Mihin kenttään asia kuuluu?

Generatiivinen tekoäly ja uudet käyttöliittymät mahdollistavat vähitellen toisenlaisen lähtökohdan. Käyttäjän ei tarvitse ensimmäisenä miettiä järjestelmää. Hän voi keskittyä siihen, mitä hän yrittää saada aikaan.

Tämä ei tee järjestelmien rakentamisesta yksinkertaisempaa, päinvastoin. Luotettava tavoitteen tulkinta, kontekstin ymmärtäminen, työkalujen käyttö, tietoturva, validointi ja virheiden hallinta ovat vaikeita ongelmia.

Mutta käyttäjän näkökulmasta juuri siinä on koko asian arvo. Paras puhekäyttöliittymä on se, joka ymmärtää, mitä ihminen on tekemässä, ja auttaa häntä tekemään sen mahdollisimman vttomasti ja luotettavasti.

Kehitä osaamistasi:

Asiantuntija

Markus Turunen

CTO

Markus Turunen