Cloud Advice.
Alle Artikel
7 min LesezeitVon Zaur Bahsaliev

KI-Pilot im Unternehmen testen: Welche Fragen eine Demo nicht beantwortet

Eine KI findet auf Anhieb das gesuchte PDF und formuliert eine glatte Antwort. In der Demo wirkt das überzeugend. Ob sie auch die veraltete Fassung erkennt, bei fehlenden Daten innehält und fremde Ordner in Ruhe lässt, zeigt erst ein richtiger Test.

Die kurze Antwort

Nehmt Fragen aus dem Arbeitsalltag und haltet vorher fest, welche Quelle eine gute Antwort tragen müsste. Testet auch Fälle ohne Antwort und mit eingeschränktem Zugriff. Erst wenn das Team Fehler erkennt und der Ablauf damit umgehen kann, ist der Pilot bereit für mehr Nutzer.

Eine gute Demo prüft den leichten Fall

Wer einen Wissensassistenten vorführt, kennt meist schon die Frage und das passende Dokument. Das ist ein sinnvoller Funktionstest, aber noch keine Aussage über den Alltag. Dort fehlen Dateinamen, Begriffe werden unterschiedlich benutzt und manche Information liegt in zwei Fassungen vor.

Entscheidend ist deshalb nicht, ob eine Antwort flüssig klingt. Interessant ist, ob die richtige Information gefunden wurde, ob die Antwort aus dieser Quelle folgt und ob eine Person sie für ihre Aufgabe verwenden kann. Microsoft trennt bei der Bewertung solcher Systeme ausdrücklich Dokumentensuche, Quellenbezug, Relevanz und Vollständigkeit. Das ist auch ohne eine spezielle Bewertungssoftware eine nützliche Unterscheidung.

Eine Testfrage, vier Prüfungen

Wer nur die fertige Antwort bewertet, übersieht leicht, an welcher Stelle der Fehler entstanden ist.

  1. 01FrageKommt sie so auch von einer echten Nutzerin oder einem echten Nutzer?
  2. 02FundstelleWurde das richtige und aktuelle Dokument gefunden?
  3. 03AntwortSteht jede wichtige Aussage tatsächlich in der Quelle?
  4. 04HandlungIst klar, was geprüft oder freigegeben werden muss?

Wichtig: Ist die Quelle falsch, hilft eine eleganter formulierte Antwort nicht. Zuerst muss die Suche korrigiert werden.

Testfragen selbst zusammenstellen

Beginnt mit einem eng begrenzten Arbeitsfall, etwa der Suche in freigegebenen Verträgen oder internen Anleitungen. Die Menschen, die diese Unterlagen benutzen, sollten Fragen aus ihrer eigenen Sprache beisteuern. Zu jeder Frage notiert ihr die erwartete Fundstelle und was eine brauchbare Antwort enthalten müsste. Nicht jede Frage braucht einen ausformulierten Mustertext.

EinfachEine aktuelle, eindeutig benannte Richtlinie findenFindet die KI die richtige Fassung und nennt sie?
MehrdeutigZwei ähnliche Verträge oder alte und neue Versionen unterscheidenFragt sie nach oder erklärt sie den Unterschied?
Ohne AntwortNach einer Information fragen, die in keiner freigegebenen Quelle stehtSagt sie offen, dass die Grundlage fehlt?
Nicht berechtigtEine Frage zu einem gesperrten Personal- oder Kundenordner stellenBleibt der Inhalt für diese Rolle unsichtbar?

Die letzte Zeile ist besonders wichtig: Ein System kann fachlich richtig antworten und trotzdem falsch sein, wenn es dafür eine Quelle benutzt, die die fragende Person nicht sehen dürfte.

Was im Testprotokoll stehen sollte

Ein einfaches Blatt reicht. Haltet pro Fall die Frage, die Rolle der testenden Person, die erwartete Quelle, die tatsächlich verwendete Quelle und das Ergebnis fest. Markiert, ob die Antwort korrekt, unvollständig, unbelegt oder unzulässig war. Ergänzt den nächsten Schritt: Dokument korrigieren, Rechte ändern, Suche verbessern oder den Anwendungsfall enger fassen.

So wird aus „Die KI lag daneben“ ein bearbeitbarer Befund. Die NIST-Leitlinien zum KI-Risikomanagement empfehlen wiederholbare, dokumentierte Tests und die Auswahl von Messgrößen passend zum jeweiligen Risiko. Ein KMU braucht dafür kein Labor. Es braucht Fälle, die seine tatsächliche Arbeit und seine Grenzen abbilden.

Wann ein Pilot weitergehen darf

Es gibt keine allgemeingültige Trefferquote, ab der ein KI-Arbeitsplatz „fertig“ ist. Eine Hilfe für interne Richtlinien darf andere Fehler machen als ein Entwurf für ein verbindliches Kundenangebot. Legt vor dem Test fest, welche Fehler tolerierbar sind, welche zwingend eine menschliche Freigabe brauchen und welche den Pilot stoppen.

Wenn kritische Fälle offen bleiben, ist das kein Argument für mehr Prompt-Tricks. Vielleicht fehlt eine gepflegte Quelle, vielleicht sind Rechte zu breit, oder die Aufgabe ist noch zu groß. Genau dafür wird klein pilotiert: damit diese Fragen vor dem Rollout auftauchen und nicht erst beim Kunden.

Von der Tool-Demo zum Arbeitsablauf

Ein guter Pilot endet nicht mit einer Folie voller Beispielantworten. Er endet mit einer Entscheidung: Für welche Fragen hilft das System zuverlässig, wo muss ein Mensch prüfen und welche Fälle werden vorerst ausgeschlossen? Wer diese Grenze erklären kann, hat mehr gewonnen als mit einer weiteren beeindruckenden Demo.

Wenn ihr noch vor der Auswahl einer Plattform steht, beginnt bei den Arbeitsfällen. Im Beitrag über die Anbindung von Outlook, Gmail und CRM zeige ich, wie sich die dafür nötigen Quellen bewusst begrenzen lassen. Bei ungeprüften privaten KI-Tools hilft zusätzlich der Artikel über Schatten-KI im Unternehmen.

Veröffentlicht von Zaur Bahsaliev, KI-Berater und Gründer von Cloud Advice in Wangen im Allgäu. Stand: 21. September 2026.

Ein KI-Pilot steht bei euch an?

Beschreib mir den Arbeitsfall. Wir klären, welche Fragen und Grenzen vor einer Einführung geprüft werden sollten.

Angebot anfragen