Cloud Computing AI
Moduuli 1 · Oppitunti 4

Avainsanat ilman mystifiointia

Oppimistavoite: Opiskelija ei säikähdä keskeisten käsitteiden lyhenteistä eikä tarvitse niitä päivittäisessä käytössä.
Lue oppitunnin tekstiversio
Tekoälykeskustelu on täynnä lyhenteitä jotka tekevät asioista monimutkaisempia kuin ne ovat. LLM. RAG. API. Token. Embedding. Parameter. Mitä ne tarkoittavat, ja mitkä niistä sinun kannattaa oikeasti tietää? Hyvä uutinen: et tarvitse mitään näistä päivittäiseen käyttöösi. Voit kirjoittaa kysymyksiä ChatGPT:lle osaamatta lyhenteitä. Mutta on muutama jotka kannattaa tunnistaa, kun törmäät niihin uutisissa tai myyntipuheessa. LLM tarkoittaa 'Large Language Model' eli isoa kielimallia. Tämä on tekninen nimi sille mitä juuri kuvasimme — tekstin täydentäjä, joka on lukenut paljon. Kun joku puhuu 'LLM:stä', he tarkoittavat sitä mitä me tällä kurssilla kutsumme tekoälykielimalliksi. Ei mitään uutta, vain hieno englanninkielinen termi. Sitten on parameter, suomeksi parametri. Kun lukee uutisissa että 'malli on kymmenien miljardien parametrin kokoinen', mitä tämä tarkoittaa? Parametri on yksi pieni säädettävä numero mallin sisällä. Mitä enemmän parametreja, sitä monimutkaisemmat suhteet malli voi muistaa lukemastaan tekstistä. Isoimmissa malleissa parametreja on kymmeniä tai satoja miljardeja. Mutta älä luota lukuun sokeasti: parametrien määrä ei suoraan tarkoita parempaa laatua. Hyvin koulutettu pieni malli voi olla parempi kuin huonosti koulutettu iso malli. Token on yksittäinen 'pala' tekstiä, jota malli käsittelee. Kuvittele sitä noin yhden suomalaisen sanan kokoiseksi — esimerkiksi 'kissa' on yksi token, 'kissalle' on todennäköisesti kaksi tokenia. Tämä on tärkeää tietää, koska tekoälypalveluiden hinnoittelu perustuu yleensä tokeneihin. Yksi miljoona tokenia maksaa vaikkapa 10 dollaria — se on noin 750 000 sanaa eli kymmenen romaania. Konteksti tai context window on muistissa pidettävän tekstin maksimimäärä. Jos lähetät ChatGPT:lle 100-sivuisen PDF:n, sen pitää mahtua kontekstiin. Nykyiset mallit pitävät muistissa noin 100 000 — 1 000 000 tokenia kerrallaan, eli 75 000 — 750 000 sanaa. Tämä riittää suurimpaan osaan käytännön työtehtäviä. RAG tarkoittaa 'Retrieval-Augmented Generation' eli haettuun tietoon perustuva tekoäly. Tämä on tekniikka, jossa tekoäly hakee ensin sinun omasta dokumenttipankistasi sopivan tekstinpalan, ja sen jälkeen vastaa tuon palan perusteella. Käytännössä tämä tarkoittaa: 'tekoäly, joka voi vastata sinun yrityksesi omiin asiakirjoihin viitaten'. Jos joku tarjoaa sinulle 'oman tekoälyn yrityksellesi', he todennäköisesti tarkoittavat RAG-pohjaista ratkaisua. API on 'Application Programming Interface' eli sovellusliittymä. Tämä tarkoittaa, että tekoäly on käytettävissä muista ohjelmista käsin, ei vain selaimessa. Tämä on yleensä se mikä mahdollistaa automaatiot — kun haluat että tekoäly käsittelee laskut automaattisesti tai vastaa asiakassähköposteihin yöllä, sen pitää olla API:n takana. Embedding tarkoittaa numeerista esitysmuotoa tekstistä. Tämä on tekninen termi, jota ei tarvitse tietää, paitsi jos rakennat itse tekoälyjärjestelmiä. Jos joku puhuu 'embeddingeistä', he viittaavat tapaan, jolla teksti muutetaan tekoälyn ymmärtämään muotoon. Yhteenveto: Päivittäisessä käytössä tarvitset käytännössä nolla näistä lyhenteistä. Lyhenteitä vilisevä tekoälypuhe on yleensä merkki siitä, että puhuja yrittää näyttää viisaammalta kuin todellisuudessa on, tai yrittää myydä sinulle jotain. Isompien lyhenteiden tunnistaminen — LLM, RAG, API, token — auttaa sinua arvioimaan myyntipuheita ja tarjouksia. Kun joku sanoo 'rakennetaan teille RAG-pohjainen LLM-ratkaisu API-rajapintojen yli', sinä osaat kääntää sen: 'rakennetaan teille tekoäly, joka voi vastata teidän omiin dokumentteihinne pohjautuen, ja sen voi liittää teidän muihin järjestelmiin'.

Kokeile nyt

Kerro omin sanoin, miten sovellat tavoitetta omassa työssäsi: Opiskelija ei säikähdä keskeisten käsitteiden lyhenteistä eikä tarvitse niitä päivittäisessä käytössä.

Kirjoita lyhyt vastaus oppitunnin harjoitukseen. Voit harjoitella ilman kirjautumista; vastaus säilyy vain tällä sivulla.

Tarkista ymmärryksesi

Joku tarjoaa yrityksellesi "RAG-pohjaista LLM-ratkaisua API-rajapintojen yli". Mitä se käytännössä tarkoittaa?

Tallenna edistymisesi ja oma oppimisyhteenvetosi

Harjoitukset ja itsearvioinnit ovat avoimia kaikille. Jätä sähköposti, niin saat työkirjan ja kurssiuutiset. Kirjautumalla voit jatkaa myöhemmin samasta kohdasta ja tallentaa omat vastauksesi.

Jättämällä sähköpostisi hyväksyt, että käsittelemme yhteystietojasi tietosuojaselosteen mukaisesti. Voit peruuttaa milloin tahansa.