Die Methode in 8 Schritten

Kurze Antwort: erst ein Codebuch einfrieren, dann in kleinen Blöcken codieren, dann außerhalb der KI zählen. Alles, was bei der KI-Auswertung schiefgeht, geht schief, weil einer dieser drei Schritte übersprungen wurde. Das Vorgehen entspricht der thematischen Analyse aus der qualitativen Forschung — der Unterschied ist nur, dass hier ein Modell codiert, dem man seine Regeln jedes einzelne Mal mitgeben muss.

1

Daten aufbereiten

Eine Antwort pro Zeile mit laufender ID (A001, A002). Leerzeilen und Nicht-Antworten raus. Die Team- oder Segmentspalte getrennt halten — lieferst du sie mit, rät das Modell entlang der Gruppe.

2

Pseudonymisieren

Namen, Projekte, Orte und Daten durch Platzhalter ersetzen, bevor irgendetwas dein System verlässt. Prompt 1 macht das — führ ihn dort aus, wo die Daten sein dürfen.

3

Codebuch aus einer Stichprobe bauen

50 bis 80 Antworten, sechs bis zehn Kategorien, jede mit Definition, Abgrenzung und zwei Ankerbeispielen. Das ist der Schritt, den alle überspringen — und der Grund, warum ihre Kategorien auseinanderlaufen.

4

Einfrieren

Ab hier ändert sich das Codebuch nicht mehr. Es wird bei jedem Block mitgeliefert, neue Kategorien sind verboten.

5

In Blöcken von 40 bis 60 codieren

Nicht 500 auf einmal. Ausgabe als CSV mit ID, nie als Fließtext. Erlaube dem Modell die Antwort nicht_zuordenbar — erzwungene Zuordnung erzeugt erfundene.

6

Sentiment in einem eigenen Durchgang

Thema und Sentiment gemeinsam abzufragen verschlechtert beides. Eigener Aufruf, mit ausdrücklicher Option unklar.

7

In der Tabelle zählen

Pivot über die Labels. Die Häufigkeit kommt nie aus der KI — diese Regel hält deine Management-Zusammenfassung überprüfbar.

8

10 Prozent selbst prüfen

Codiere ein zufälliges Zehntel von Hand und vergleiche. Über etwa 15 Prozent Abweichung schärfst du das Codebuch, statt das Modell zu wechseln. Automatisierte Annotation erfordert menschliche Validierung — das ist der dokumentierte Konsens, keine Nettigkeit.

Die 6 Prompts

Kopiere sie unverändert. Stell das Modell für Codieraufgaben auf niedrige Kreativität, notiere die verwendete Modellversion und behalte sie über alle Blöcke bei — wechselst du mitten in der Auswertung das Modell, misst du den Modellwechsel statt der Antworten.

Du bist ein Datenschutz-Assistent. Deine einzige Aufgabe ist Pseudonymisierung.

Ersetze in JEDER Antwort:
- Personennamen → [PERSON_1], [PERSON_2] (gleicher Name = gleiche Nummer)
- Führungskräfte mit Namensbezug → [FÜHRUNGSKRAFT]
- Team-, Abteilungs-, Standort-, Firmennamen → [TEAM], [STANDORT], [FIRMA]
- Projekt- und Produktnamen → [PROJEKT]
- Konkrete Daten → [DATUM]

Regeln:
- Ändere sonst KEIN Wort. Keine Umformulierung, keine Korrektur von Tippfehlern.
- Gib jede Zeile zurück, auch unveränderte.
- Wenn eine Antwort trotz Ersetzung eine Person identifizierbar macht, markiere sie am Zeilenende mit RESTRISIKO.

Ausgabe: ID | anonymisierte Antwort | RESTRISIKO (falls zutreffend)

Antworten:
[HIER EINFÜGEN]

Du bist erfahren in qualitativer Inhaltsanalyse.

Kontext: Befragung mit [ANZAHL] Teilnehmenden. Die Frage lautete wörtlich: "[FRAGE]"

Aufgabe: Entwickle aus den folgenden Antworten ein Codebuch. Ordne noch KEINE einzelnen Antworten zu.

Anforderungen:
- 6 bis 10 Kategorien. Nicht mehr. Aggregiere, wenn du mehr Themen siehst.
- Die Kategorien müssen trennscharf sein.
- Sie müssen aus DIESEN Daten stammen, nicht aus allgemeinem Vorwissen.
- Keine Kategorie darf so allgemein sein, dass mehr als 40 Prozent der Antworten hineinpassen.

Liefere je Kategorie:
1. Kurzname (max. 3 Wörter)
2. Definition in einem Satz
3. Abgrenzung: "Nicht hierher gehört: ..."
4. Zwei Ankerbeispiele, WÖRTLICH aus den Daten, mit ID

Ergänze die Pflichtkategorie "nicht_zuordenbar".
Nenne am Ende Themen, die in keine Kategorie passten.

Antworten:
[50-80 ANTWORTEN EINFÜGEN]

Du codierst Antworten nach einem FESTEN Codebuch. Du darfst es nicht erweitern, umbenennen oder umdeuten.

CODEBUCH (verbindlich):
[CODEBUCH AUS PROMPT 2 EINFÜGEN]

Regeln:
- Genau EINE Hauptkategorie je Antwort.
- Optional eine Nebenkategorie, wenn ein zweites Thema klar erkennbar ist.
- Erfinde KEINE neue Kategorie. Passt nichts: "nicht_zuordenbar".
- Bei Unsicherheit: "nicht_zuordenbar" plus Grund in der Spalte Notiz. Unsicherheit ist ein gültiges Ergebnis, Raten nicht.
- Bearbeite die Antworten in der gegebenen Reihenfolge, überspringe keine.
- Gib exakt so viele Zeilen zurück, wie du Antworten bekommen hast.

Ausgabe als CSV mit Kopfzeile, ohne Einleitung:
ID;Hauptkategorie;Nebenkategorie;Konfidenz(hoch|mittel|niedrig);Notiz

Antworten:
[BLOCK VON MAX. 60 EINFÜGEN]

Du bewertest die Grundstimmung von Freitextantworten. Eigener Durchgang, unabhängig vom Thema.

Skala, genau eine Auswahl je Antwort:
positiv | eher_positiv | neutral | eher_negativ | negativ | unklar

Regeln:
- "unklar" ist ausdrücklich erwünscht bei sehr kurzen Antworten ohne klare Wertung, reinen Sachaussagen, erkennbarer Ironie und gemischten Aussagen ohne Übergewicht.
- Achte auf deutsche Untertreibung: "nicht schlecht" = eher_positiv, "an sich okay, aber ..." = eher_negativ, "läuft ja super hier" im ironischen Kontext = unklar, NICHT positiv.
- Bewerte die Stimmung der schreibenden Person, nicht das Thema. Eine höflich formulierte Beschwerde ist negativ.
- Bewerte NICHT, wie wichtig die Aussage ist.

Ausgabe als CSV, ohne Einleitung:
ID;Sentiment;Ironie_vermutet(ja|nein);Belegwort(wörtlich aus der Antwort)

Antworten:
[BLOCK EINFÜGEN]

Du wählst Belegzitate für einen Ergebnisbericht aus.

ABSOLUTE REGEL: Jedes Zitat muss zeichengenau im Ausgangstext stehen. Nicht umformulieren, nicht glätten, keine Tippfehler korrigieren, nichts zusammenziehen. Wenn du versucht bist zu formulieren, nimm ein anderes Zitat.

Aufgabe: Wähle zur Kategorie "[KATEGORIE]" bis zu 4 Zitate.
Kriterien in dieser Reihenfolge:
1. typisch für die Kategorie, nicht das dramatischste
2. ohne Zusatzkontext verständlich
3. enthält keine identifizierenden Details
4. eines soll eine ABWEICHENDE Sicht innerhalb der Kategorie zeigen, falls vorhanden

Je Zitat: ID, Zitat wörtlich, die ersten 4 Wörter noch einmal separat zur Prüfung, und in einem Satz warum du es gewählt hast.

Findest du weniger als 4 geeignete, gib weniger zurück und schreibe "Nur X geeignete Zitate gefunden". Fülle NICHT auf.

Quelltexte:
[ANTWORTEN DER KATEGORIE EINFÜGEN]

Du suchst gezielt das, was in einer Zusammenfassung untergehen würde.

Finde in den folgenden Antworten:
A) Aussagen, die dem Mehrheitsbild widersprechen, auch wenn sie nur ein- oder zweimal vorkommen
B) Themen von weniger als 5 Prozent der Antwortenden, die inhaltlich schwer wiegen (Konflikte, Überlastung, Fehlverhalten, Sicherheit, rechtliche Themen)
C) innere Widersprüche: Antwortgruppen, die sich zum selben Sachverhalt widersprechen

Regeln:
- Fasse NICHT zusammen und glätte NICHT. Zitiere wörtlich mit ID.
- Bewerte nicht, ob die Aussage stimmt. Du sammelst nur.
- Sortiere NICHT nach Häufigkeit. Eine einzelne Nennung kann an erster Stelle stehen.
- Findest du zu einer Rubrik nichts, schreibe "keine gefunden". Erfinde nichts.

Ausgabe:
A) ID – wörtliches Zitat – wem es widerspricht
B) ID – wörtliches Zitat – warum relevant
C) Sachverhalt – ID und Zitat je Seite

Antworten:
[ALLE ANTWORTEN EINFÜGEN]

Was die KI falsch macht

Keine Anbieterseite listet das auf, weil jede Anbieterseite das Analyse-Modul verkauft. Das hier sind die Fehlermodi, denen du tatsächlich begegnest — sortiert nach dem Schaden, den sie anrichten.

FehlermodusWas passiertGegenmittel
Erfundene ZitateEin plausibles, leicht umformuliertes oder ganz erfundenes Zitat landet auf Folie 3, und niemand prüft es nachWörtlichkeits-Zwang + ID + die ersten vier Wörter in den Rohdaten suchen
Abweichung vom OriginalThematische Zusammenfassungen können sich vom eigentlichen Gehalt der Antworten entfernen — genau für diese Aufgabe dokumentiert10 Prozent von Hand prüfen; die Zusammenfassung als Entwurf behandeln
Minderheitsmeinungen verschwindenModelle bevorzugen mehrheitskonforme Inhalte; die vier Hinweise auf einen Konflikt verschwinden in „Wunsch nach besserer Kommunikation"Prompt 6 als eigenen Durchgang, jedes Mal
Ironie und UntertreibungDie Genauigkeit bei sarkastischen Inhalten fällt auf etwa 30 Prozent; deutsche Litotes dreht das Vorzeichen umAusdrückliche Option unklar; nie auf ein einzelnes Sentiment-Label hin handeln
Kategorien-DriftBlock drei erfindet Kategorien, die Block eins nicht hatte — die Häufigkeiten sind nicht mehr vergleichbarCodebuch einfrieren, bei jedem Block mitsenden, neue Kategorien verbieten
In der Mitte verlorenAntwort 250 von 500 bekommt weniger Aufmerksamkeit als Antwort 1 — Positionsverzerrung ist gut dokumentiertKleine Blöcke; die Reihenfolge einmal umdrehen als Gegenprobe
Anderes Ergebnis beim zweiten LaufDie Ausgabe schwankt zwischen Läufen, selbst bei identischem Prompt und Kreativität nullKritische Fälle mehrfach klassifizieren; die Modellversion festhalten

Die KI etikettiert. Die Tabelle zählt. Ein Sprachmodell erzeugt plausible Zahlen, keine richtigen — und ausgerechnet die Häufigkeit landet vor der Geschäftsführung. Lass das Modell Kategorien vergeben und zähl die Labels selbst. Diese eine Trennung verhindert den größten Teil des Schadens auf dieser Seite.

DSGVO und Freitext

Freitext aus einer Befragung ist regelmäßig personenbezogen, auch wenn die Befragung als anonym angekündigt war — denn Menschen schreiben Namen, Projekte und Ereignisse hinein. In einem Acht-Personen-Team identifiziert „ich habe letzte Woche als Projektleiter den Rollout verantwortet" eine Person so sicher wie ein Name. Die Rückführbarkeit entsteht meist durch kleine Gruppen, konkrete Ereignisse, wiederkehrenden Schreibstil und genannte Namen — nicht durch ein fehlendes Häkchen bei der Anonymisierung.

Drei praktische Folgen. Erstens braucht es einen Auftragsverarbeitungsvertrag, sobald personenbezogene Daten ein externes Modell erreichen — die Consumer-Stufen von ChatGPT bieten keinen und nutzen Inhalte standardmäßig zum Training, womit sie für Daten Dritter ausscheiden; Business- und API-Stufen bieten einen. Zweitens: vor dem Hochladen pseudonymisieren, und zwar dort, wo die Daten ohnehin sein dürfen — lässt du das Modell die Rohdaten anonymisieren, hast du sie bereits übermittelt. Drittens: eine Mindestgruppengröße von fünf einhalten, bevor ein Gruppenergebnis freigegeben wird; größere Organisationen und solche mit Betriebsrat nehmen üblicherweise zehn. Sag den Befragten, dass KI zur Auswertung genutzt wird — das ist eine Transparenzpflicht und hebt nebenbei die Rücklaufquote.

So geht es mit Teamo

Alles oben beschreibt die Auswertung von Hand mit einem allgemeinen Modell. Das funktioniert und kostet dich einen Nachmittag je Befragung. Die Alternative ist, die Antworten dort zu sammeln, wo der Codier-Schritt nach denselben Regeln bereits passiert — mit EU-Hosting, vorhandenem Auftragsverarbeitungsvertrag und einer Mindestgruppengröße, die in der Software durchgesetzt wird und nicht in einer Richtlinie steht.

Es gibt außerdem einen Weg, einen Teil des Problems ganz zu vermeiden. Der größte Teil der Mühe in diesem Artikel entsteht durch offene Antworten, die zu vage sind, um sie zu kategorisieren — „die Kommunikation könnte besser sein" lässt sich in nichts Handlungsleitendes codieren, egal wie gut dein Prompt ist. Ein KI-Interview, das nachfragt, während die Person noch antwortet, erzeugt von vornherein konkreten Text — und spart damit mehr Auswertungsarbeit, als jede Prompt-Optimierung es kann.

Erheben und auswerten an einem Ort — 14 Tage kostenlos

Die Antworten kommen bereits konkret herein, weil die KI nachfragt, Themen und Zitate werden für dich zusammengefasst, und die Mindestgruppengröße setzt die Software durch. EU-gehostet. 14 Tage kostenlos, ohne Kreditkarte.

Jetzt ausprobieren