Så mäter ni om AI-chatten faktiskt levererar

Nyckeltalen som betyder något, siffrorna som lurar er och en månadsrutin som tar en timme.

Person tittar på diagram på laptop – uppföljning av chattens resultat

Hur mäter man om en AI-chatt levererar? Nyckeltalen som faktiskt betyder något, siffrorna som lurar er och hur ni bygger en enkel månadsuppföljning.

Chatten är lanserad och siffrorna rullar in: antal konversationer, antal användare, svarstider. Men säger de siffrorna något om affären? Antal konversationer är ett aktivitetsmått – det bevisar att chatten används, inte att den gör nytta. Den här guiden går igenom vilka nyckeltal som faktiskt visar om AI-chatten levererar, vilka som lurar er och hur ni bygger en uppföljning som tar en timme i månaden.

Snabbsvar: Mät en AI-chatt på tre nivåer: lösningsgrad – hur stor andel av frågorna som besvaras utan att skickas vidare; avlastning – hur ärendevolymen i mejl och telefon förändras; och affärseffekt – leads, bokningar eller köp som chatten bidrar till. Antal konversationer i sig säger ingenting utan de tre.

Vilka nyckeltal ska vi följa – och varför?

Fem mått räcker för de flesta verksamheter. Fler än så blir en rapport ingen läser.

  1. Lösningsgrad. Andelen konversationer där besökaren fick svar utan att behöva mejla, ringa eller ge upp. Chattens viktigaste kvalitetsmått.

  2. Obesvarade frågor. Både antal och innehåll. Varje obesvarad fråga är en konkret uppgift: komplettera underlaget eller förtydliga hänvisningen.

  3. Ärendevolym i andra kanaler. Minskar rutinfrågorna i mejl och telefon? Det är avlastningen ni betalar för – mät den mot nivån före lansering.

  4. Aktivitet utanför öppettid. Andelen konversationer på kvällar och helger visar värde som inte fanns alls tidigare – frågor som annars förblivit oställda.

  5. Affärshändelser. Bokningar, offertförfrågningar, köp eller leads där chatten var inblandad. Det som till sist motiverar investeringen.

Vilka siffror lurar oss?

De vanligaste felmåtten är de som ser bäst ut i en rapport. Här är skillnaden mellan mått som imponerar och mått som informerar.

Måttet

Problemet

Mät i stället

Antal konversationer

Hög volym kan lika gärna betyda förvirrade besökare som nöjda

Volym i kombination med lösningsgrad

Svarstid

En AI svarar alltid snabbt – måttet skiljer inte bra från dåligt

Om svaret faktiskt löste ärendet

Tummen upp-betyg

Få klickar – de som gör det är sällan representativa

Stickprov av verkliga konversationer

Ett exempel på mått som faktiskt säger något: hos vår kund Svensk Innebandy handlade det inte bara om att chatten tog 5 181 frågor under ett kvartal – utan om att de kom från 2 575 olika användare. Bredden visar att chatten når människor som annars aldrig hört av sig, och det är ett värde som inget aktivitetsmått fångar.

Hur bygger vi en uppföljning som faktiskt blir av?

Gör den liten och återkommande. En timme i månaden, samma person, samma tre steg: läs de obesvarade frågorna, skumma ett stickprov på tjugo konversationer, jämför ärendevolymen i mejl och telefon med förra månaden.

Stickprovet är viktigare än det låter. Siffror visar vad som händer – konversationerna visar varför. Tjugo lästa konversationer i månaden räcker för att upptäcka mönster långt innan de syns i statistiken.

Avsluta varje genomgång med högst tre åtgärder: komplettera underlaget här, förtydliga svaret där, lyft det här mönstret till ledningen. Uppföljning utan åtgärder är statistik – uppföljning med åtgärder är förbättring.

Hur räknar vi hem chatten i kronor?

Ta antalet frågor chatten löste under en månad och multiplicera med vad ett manuellt ärende kostar er i arbetstid. Jämför med månadskostnaden. Det är en förenkling – den missar värdet av nöjdare kunder och frågor utanför öppettid – men den ger ett golv som går att försvara i en budgetdiskussion.

Hur man sätter upp hela kalkylen, inklusive vad som driver kostnadssidan, har vi gått igenom i vår guide om vad en AI-chatbot kostar.

När ska vi inte lita på siffrorna?

De första veckorna. Då mäter ni intrimning, inte potential – underlaget har luckor som ännu inte täppts och besökarna har inte hunnit vänja sig vid att chatten finns. Vänta två till tre månader innan ni drar slutsatser om helheten, men agera på obesvarade frågor från dag ett.

Var också försiktig med att jämföra er lösningsgrad med siffror från andra företag eller leverantörers marknadsföring. Måtten definieras olika, och en hög lösningsgrad kan uppnås genom att chatten gissar i stället för att hänvisa vidare – vilket är motsatsen till kvalitet. Jämför er med er egen förra månad, inte med andras reklam.

Vanliga frågor om att mäta AI-chattens resultat

Vad är en bra lösningsgrad?

Det beror på hur breda frågor chatten får och hur strikt ni definierar ‘löst’. Ett smalt, väldokumenterat område ger hög lösningsgrad; en bred verksamhet med många specialfall ger lägre. Viktigare än nivån är riktningen: en lösningsgrad som stiger månad för månad betyder att uppföljningen fungerar.

Hur vet vi att minskningen i mejl och telefon beror på chatten?

Helt säkert vet ni aldrig – säsong och kampanjer påverkar också. Men ni kommer långt genom att jämföra ärendetyper: om just de frågor chatten besvarar minskar i mejlen medan övriga ligger stilla är sambandet tydligt. Notera nivån före lansering, annars har ni inget att jämföra med.

Behöver vi koppla chatten till vår webbanalys?

Det är inte nödvändigt för att komma igång, men värdefullt när ni vill mäta affärseffekt: då kan ni se om besökare som använder chatten oftare går vidare till bokning eller köp. Börja med chattens egen statistik, och lägg till webbanalysen när grundrutinen sitter.

Vem ska äga uppföljningen – vi eller leverantören?

Båda, med olika roller. Leverantören ska leverera statistiken, flagga avvikelser och föreslå förbättringar. Men bedömningen av vad siffrorna betyder för affären kan bara ni göra – det kräver kunskap om er verksamhet. Se upp med upplägg där ingen på ert företag någonsin tittar på siffrorna.

Chatten får bra siffror men kunderna klagar ändå – vad gör vi?

Lita på kunderna. Läs klagomålen och leta upp de konversationer de handlar om – ofta visar det sig att chatten tekniskt sett ‘svarade’ men inte hjälpte, eller att överlämningen till människa var för trög. Justera definitionen av löst ärende därefter. Mått ska tjäna kundupplevelsen, aldrig ersätta den.

En AI-chatt utan uppföljning blir långsamt sämre; en med enkel månadsrutin blir stadigt bättre. Vill ni ha hjälp att sätta upp mätningen för er chatt kan ni kontakta oss.