Siirry sisältöön
Tekoälli

Raha

Miksi tekoälyn hinta yllättää

Opettaminen on erillinen investointi. Käyttäminen maksaa joka ikinen kerta.

Harri Salomaa2 min

Yksi korkea pylväs opetuksen kertainvestoinnista ja sen rinnalla loputon rivi pieniä pylväitä, jotka kuvaavat joka kerta maksavaa käyttöä.
Sisällys (5)

Tekoälyprojektin talous jakautuu kahteen hyvin erilaiseen osaan: kertaluonteisiin investointeihin ja jatkuviin kuluihin. Yllätykset syntyvät melkein aina jälkimmäisestä.

Investoinnit ja jatkuvat kulut

Investointeja ovat datakeskukset, sirut ja palvelimet, mallin koulutus, datan hankinta ja tuotekehitys. Ne maksetaan pääosin etukäteen.

Jatkuvia kuluja ovat inferenssi, sähkö ja jäähdytys, pilvipalvelut, tallennus ja tiedonsiirto, henkilöstö sekä valvonta, tietoturva ja asiakastuki. Ne juoksevat niin kauan kuin palvelu on käytössä.

Malliyhtiölle koulutus on valtava panostus, mutta ei kertaluonteinen samassa mielessä kuin rakennus: mallit vanhenevat, joten koulutus, jälkikoulutus ja arviointi toistuvat sukupolvi toisensa jälkeen. Sovellusyritykselle koulutus ei yleensä ole kuluerä lainkaan, sillä sen lasku syntyy inferenssistä, joka kasvaa suoraan käytön mukana.

Mistä inferenssin hinta muodostuu

Yhden vastauksen hintaan vaikuttavat:

  • mallin koko
  • syötteen pituus
  • vastauksen pituus
  • päättelykierrosten määrä
  • käytetty laskentatarkkuus
  • yhtä aikaa palveltavien käyttäjien määrä
  • kuinka hyvin kyselyt voidaan käsitellä erissä
  • laitteiden käyttöaste.

Näistä useimpiin voi vaikuttaa suunnittelulla. Mallin valinta on vain yksi muuttuja monesta.

Miksi demo on halpa ja tuotanto kallis

Demossa on yksi käyttäjä, lyhyet syötteet ja yksi mallikutsu vastausta kohti. Tuotannossa tilanne muuttuu:

  • käyttäjiä tulee paljon
  • jokainen syöte sisältää paljon dokumentteja
  • vastaukset ovat pitkiä
  • agentti tekee monta mallikutsua yhtä tehtävää varten
  • järjestelmä käyttää suurinta mallia myös helppoihin tehtäviin
  • kapasiteettia varataan enemmän kuin todella käytetään.

Kertautuminen on olennaista: jos yksi käyttäjän pyyntö laukaisee kymmenen mallikutsua ja jokaisessa on mukana kymmenen dokumenttia, dokumenteista luettavien tokenien määrä satakertaistuu. Koko lasku ei kasva aivan samassa suhteessa, koska siihen vaikuttavat myös vastausten pituus, toistuvan osan välimuistitus ja se, käytetäänkö joka askeleeseen samaa mallia. Suuruusluokka on silti tämä, ja juuri se yllättää.

Miten kustannusta hillitään

Tavallisimmat ja tehokkaimmat keinot:

  • Oikea malli oikeaan tehtävään. Luokittelu, poiminta ja muotoilu onnistuvat usein pienellä mallilla. Suuri malli varataan vaikeisiin tapauksiin.
  • Lyhyempi konteksti. Haetaan promptiin vain olennaiset kappaleet, ei koko dokumenttia.
  • Välimuisti. Toistuvat kysymykset ja uudelleenkäytettävät osat tallennetaan.
  • Erissä käsittely. Kiireettömät työt ajetaan silloin, kun kapasiteettia on vapaana.
  • Kierrosten katto. Agentille asetetaan enimmäismäärä askelia ja kustannusta per tehtävä.
  • Mittaus. Kustannus per tapaus, per käyttäjä ja per ominaisuus näkyviin heti, ei vasta laskulta.

Muista hinnoittelun toinen puoli

Kustannuksen rinnalla kannattaa katsoa, mistä asiakas maksaa. Jos hinnoittelu on kiinteä kuukausimaksu mutta kulu syntyy käytöstä, raskaimmat käyttäjät voivat kääntää katteen negatiiviseksi. Käyttöön tai saavutettuun tulokseen sidottu hinnoittelu pitää nämä kaksi samassa tahdissa.

kustannuksetinferenssiliiketoiminta

Harri Salomaa · 40 vuotta ohjelmistoalalla, siitä 20 Yhdysvalloissa ja Saksassa: prosessidatan keruusta ja verkkodatan analysoinnista immersiiviseen laskentaan ja viimeksi tekoälyyn.

Jaa tämä juttu