KI-Pilot im Unternehmen testen: Welche Fragen eine Demo nicht beantwortet
Eine KI findet auf Anhieb das gesuchte PDF und formuliert eine glatte Antwort. In der Demo wirkt das überzeugend. Ob sie auch die veraltete Fassung erkennt, bei fehlenden Daten innehält und fremde Ordner in Ruhe lässt, zeigt erst ein richtiger Test.
Die kurze Antwort
Nehmt Fragen aus dem Arbeitsalltag und haltet vorher fest, welche Quelle eine gute Antwort tragen müsste. Testet auch Fälle ohne Antwort und mit eingeschränktem Zugriff. Erst wenn das Team Fehler erkennt und der Ablauf damit umgehen kann, ist der Pilot bereit für mehr Nutzer.
Eine gute Demo prüft den leichten Fall
Wer einen Wissensassistenten vorführt, kennt meist schon die Frage und das passende Dokument. Das ist ein sinnvoller Funktionstest, aber noch keine Aussage über den Alltag. Dort fehlen Dateinamen, Begriffe werden unterschiedlich benutzt und manche Information liegt in zwei Fassungen vor.
Entscheidend ist deshalb nicht, ob eine Antwort flüssig klingt. Interessant ist, ob die richtige Information gefunden wurde, ob die Antwort aus dieser Quelle folgt und ob eine Person sie für ihre Aufgabe verwenden kann. Microsoft trennt bei der Bewertung solcher Systeme ausdrücklich Dokumentensuche, Quellenbezug, Relevanz und Vollständigkeit. Das ist auch ohne eine spezielle Bewertungssoftware eine nützliche Unterscheidung.
Eine Testfrage, vier Prüfungen
Wer nur die fertige Antwort bewertet, übersieht leicht, an welcher Stelle der Fehler entstanden ist.
- 01FrageKommt sie so auch von einer echten Nutzerin oder einem echten Nutzer?
- 02FundstelleWurde das richtige und aktuelle Dokument gefunden?
- 03AntwortSteht jede wichtige Aussage tatsächlich in der Quelle?
- 04HandlungIst klar, was geprüft oder freigegeben werden muss?
Wichtig: Ist die Quelle falsch, hilft eine eleganter formulierte Antwort nicht. Zuerst muss die Suche korrigiert werden.
Testfragen selbst zusammenstellen
Beginnt mit einem eng begrenzten Arbeitsfall, etwa der Suche in freigegebenen Verträgen oder internen Anleitungen. Die Menschen, die diese Unterlagen benutzen, sollten Fragen aus ihrer eigenen Sprache beisteuern. Zu jeder Frage notiert ihr die erwartete Fundstelle und was eine brauchbare Antwort enthalten müsste. Nicht jede Frage braucht einen ausformulierten Mustertext.
Die letzte Zeile ist besonders wichtig: Ein System kann fachlich richtig antworten und trotzdem falsch sein, wenn es dafür eine Quelle benutzt, die die fragende Person nicht sehen dürfte.
Was im Testprotokoll stehen sollte
Ein einfaches Blatt reicht. Haltet pro Fall die Frage, die Rolle der testenden Person, die erwartete Quelle, die tatsächlich verwendete Quelle und das Ergebnis fest. Markiert, ob die Antwort korrekt, unvollständig, unbelegt oder unzulässig war. Ergänzt den nächsten Schritt: Dokument korrigieren, Rechte ändern, Suche verbessern oder den Anwendungsfall enger fassen.
So wird aus „Die KI lag daneben“ ein bearbeitbarer Befund. Die NIST-Leitlinien zum KI-Risikomanagement empfehlen wiederholbare, dokumentierte Tests und die Auswahl von Messgrößen passend zum jeweiligen Risiko. Ein KMU braucht dafür kein Labor. Es braucht Fälle, die seine tatsächliche Arbeit und seine Grenzen abbilden.
Wann ein Pilot weitergehen darf
Es gibt keine allgemeingültige Trefferquote, ab der ein KI-Arbeitsplatz „fertig“ ist. Eine Hilfe für interne Richtlinien darf andere Fehler machen als ein Entwurf für ein verbindliches Kundenangebot. Legt vor dem Test fest, welche Fehler tolerierbar sind, welche zwingend eine menschliche Freigabe brauchen und welche den Pilot stoppen.
Wenn kritische Fälle offen bleiben, ist das kein Argument für mehr Prompt-Tricks. Vielleicht fehlt eine gepflegte Quelle, vielleicht sind Rechte zu breit, oder die Aufgabe ist noch zu groß. Genau dafür wird klein pilotiert: damit diese Fragen vor dem Rollout auftauchen und nicht erst beim Kunden.
Von der Tool-Demo zum Arbeitsablauf
Ein guter Pilot endet nicht mit einer Folie voller Beispielantworten. Er endet mit einer Entscheidung: Für welche Fragen hilft das System zuverlässig, wo muss ein Mensch prüfen und welche Fälle werden vorerst ausgeschlossen? Wer diese Grenze erklären kann, hat mehr gewonnen als mit einer weiteren beeindruckenden Demo.
Wenn ihr noch vor der Auswahl einer Plattform steht, beginnt bei den Arbeitsfällen. Im Beitrag über die Anbindung von Outlook, Gmail und CRM zeige ich, wie sich die dafür nötigen Quellen bewusst begrenzen lassen. Bei ungeprüften privaten KI-Tools hilft zusätzlich der Artikel über Schatten-KI im Unternehmen.