Siirry sisältöön
Tekoälli

Kerros 2

Data

Mistä kone oppii, ja miksi omat tiedot ovat arvokkainta, mitä yrityksellä on.

Tällä sivulla

Malli oppii esimerkeistä. Datan määrä ei kuitenkaan yksin ratkaise: tärkeitä ovat laatu, kattavuus, oikeellisuus, käyttöoikeudet ja se, vastaako data oikeaa käyttötilannetta.

Mitä tässä kerroksessa tapahtuu

  1. 01

    Data on monenmuotoista

    Tekstiä, kuvia ja videota, ääntä, ohjelmakoodia, mittausdataa, yrityksen tapahtumatietoja, ihmisten kirjoittamia kysymys–vastaus-esimerkkejä ja koneen itse tuottamaa dataa.

  2. 02

    Vaikein työ on omien tietojen järjestäminen

    Tiedot ovat eri järjestelmissä, sama sana tarkoittaa eri paikoissa eri asiaa, käyttöoikeudet ovat epäselviä ja osa tiedoista on vanhentunutta.

  3. 03

    Arka tieto vaatii rajaukset

    Kaikkea ei saa näyttää kaikille. Käyttöoikeudet on ratkaistava ennen kuin tiedot viedään mallin ulottuville.

  4. 04

    Oma data voi olla suurin etu

    Yrityksen oma aineisto voi olla arvokkaampaa kuin mahdollisuus opettaa hieman isompi malli.

Yleinen harhaluulo

Keskeiset käsitteet

Koko sanasto →
Embedding
Sisällön numeerinen esitys, jonka avulla samankaltaisia asioita voi etsiä.
Vektoritietokanta
Järjestelmä embeddingien tallentamiseen ja samankaltaisuushakuun.
Synteettinen data
Simuloitu tai tekoälyn tuottama opetusaineisto.
Evaluaatio (eval)
Järjestelmällinen testi mallin tai koko sovelluksen laadulle.
Ylisovittaminen
Malli opettelee esimerkit ulkoa sen sijaan, että oppisi asian.