Hyppää sisältöön

Tekoälyavusteinen testisuunnittelu ja LLM-arviointi asiakaspalveluagenteille

Lyhyesti

Toimiala: Energia

Ratkaisu: Täysin uudenlainen asiakaspalvelumalli, jossa tekoäly toimii ensimmäisenä kontaktipisteenä ja osana asiakkaan palvelupolkua. Useita tekoälypohjaisia asiakaspalveluagentteja kehitettiin ja ylläpidettiin yhdessä kanavakohtaisten tietokantojen, testijoukkojen ja arviointikonfiguraatioiden kanssa.

Toteutustapa: LLM-pohjaisten agenttien laadunvarmistus, erityisesti vastausten oikeellisuuden, olennaisuuden ja hallusinaatioiden hallinnan automatisoitu arviointi hyödyntäen LLM-as-a-judge-mallia, jolloin testaus perustuu semanttiseen laatuun tarkan merkkijonovertailun sijaan.

Avainsanat: GitHub Copilot, DeepEval, LLM-as-a-judge, Regressiotestaus, Testiautomaatio

Käytännön toteutus

Tavoitteena oli tehdä tekoälyagenttien testauksesta toistettavaa, versionhallittua ja skaalautuvaa eri liiketoiminta-alueilla ja kanavissa. Käytännössä tiimi rakensi standardoidun testijoukko- ja kansiorakenteen, jossa kysymys-vastaus-parit, arviointiasetukset ja referenssidata pidetään versionhallinnassa. DeepEval-automaatioita käytettiin arvioimaan mittareita, kuten oikeellisuutta, vastauksen relevanssia, toksisuutta ja kieltäytymiskäyttäytymistä.

GitHub Copilotia käytettiin tukemaan testien suunnittelua ja valmistelutyötä, erityisesti kysymys-vastaus-variaatioiden laatimisessa, testitapausrakenteiden muotoilussa ja JSON-muotoisen testiaineiston valmistelussa lähdemateriaalista. Tämä nopeutti yhtenäisten testiresurssien luomista.

Ihmisten tekemä validointi suoritettiin agenttien arviointitulosten ja löydösten perusteella.

Tulokset

Suoritettujen testien määrä kasvoi testidatan automatisoinnin ansiosta verrattuna manuaaliseen data-analyysiin ja testitapausten kirjoittamiseen. Automaattinen arviointi ja esivalidointi tekivät tulosten analysoinnista huomattavasti tehokkaampaa verrattuna siihen, että ihmistestaaja validoisi jokaisen tuloksen erikseen.

Asiakkaat saavat vastauksia ja voivat hoitaa asiansa välittömästi, ja yli 80 % raportoi positiivisesta asiointikokemuksesta tekoälyn kanssa. Ratkaisu on keventänyt asiakaspalvelun kuormitusta ja luonut skaalautuvan perustan jatkuvalle kehitykselle.

1000+
Testitapausta

208
Testijoukkoa

20 000+
Riviä JSONia

Etsi