Tekoälydemot ovat helppoja. Tekoälyn tuotantokäyttö on vaikeaa. Ero näkyy yleensä kuusi kuukautta käyttöönoton jälkeen, kun malli on rappeutunut, kustannukset karanneet, käyttäjäkokemus huonontunut ja vastuukysymykset ovat avoimia.
Tuotantotason AI vaatii, että jokainen malli, prompt ja datatuotteen versio on tunnistettavissa. Jos tuotannossa syntyy häiriö, on pystyttävä sanomaan: mikä malli oli ajossa, millä versiolla, millä prompt-konfiguraatiolla ja millä datalla. Useimmat yritykset käyttävät edelleen "viimeisin GPT-versio" -filosofiaa, joka tarkoittaa, että mallin käyttäytyminen muuttuu provider-päivityksellä ilman, että yritys tietää.
Tuotantomalli vaatii kolmen tason monitoroinnin: tekninen (latenssi, virheet, käyttömäärä), mallikohtainen (tarkkuus, drift, biaksen indikaattorit) ja liiketoiminta (vaikutus euroissa, käyttäjäkokemus, NPS-vaikutus). Klassiset APM-työkalut riittävät tasolle 1. Tasot 2 ja 3 vaativat AI-spesifejä työkaluja tai LLMOps-alustan, joka ymmärtää mallien käyttäytymistä.
Jos tuotantomalli alkaa käyttäytyä huonosti, miten se palautetaan edelliseen versioon? Onko olemassa kontrolloitu prosentti liikennettä, jolla uusi versio testataan ennen täysimittaista käyttöönottoa? Useimmissa yrityksissä vastaus näihin on "ei tiedetä" tai "manuaalisesti, kestää tunteja".
LLMOpsin uusi rooli on prompt-hallinta. Prompt ei ole "tiedosto" tai "merkkijono" — se on versioitu artefakti, jolla on testit, käyttöoikeudet ja muutoshistoria. Promptin muutos käyttötapauksessa on yhtä iso tapahtuma kuin koodimuutos. Hyvä alusta tarjoaa prompt-rekisterin, automaattiset testit (regressiot, tonality checks, hallusinaatiotarkistukset) ja A/B-testauksen prompt-versioiden välillä.
LLM-kustannukset karkaavat helposti. Yksi keskikokoinen käyttötapaus voi maksaa 5 000 euroa tai 50 000 euroa kuukaudessa, riippuen tavasta, jolla sitä kutsutaan, mallin valinnasta ja konteksti-ikkunan käytöstä. Ilman per-agentti ja per-käyttötapaus kustannusrajoituksia yritys ei näe kustannusten todellista jakaumaa. Hyvä LLMOps-alusta tuo kustannukset näkyviin reaaliajassa ja mahdollistaa rajoitusten asettamisen ennen kustannuspommia.