Prompts
Marke genannt oder offen gefragt: Zwei unterschiedliche KI-Tests
So planen Sie zusammengehörige Fragen mit und ohne Zielmarke, halten Gesprächskontexte auseinander und berichten Nennungen und Produktprüfung mit getrennten Bezugsgrößen.
Die Fachbeiträge erscheinen derzeit auf Deutsch.
Eine offene Anbieterfrage prüft, ob Ihre Zielmarke im untersuchten Antwortset ohne ausdrückliche Vorgabe berücksichtigt wird. Eine Frage mit dieser Marke prüft, wie das System den bereits genannten Anbieter einordnet. Beide Aufgaben sind sinnvoll, brauchen aber getrennte Prompts, Auswertungsregeln und Ergebnisnenner. Verbinden Sie sie über denselben dokumentierten Kaufkontext. Zählen Sie eine vorgegebene Markennennung niemals als ungestützte Entdeckung und leiten Sie aus den Antworten weder Suchvolumen noch Marktbekanntheit ab.
Zwei legitime Fragen, zwei unterschiedliche Erkenntnisse
„Welche CRM-Lösung kommt für unser Team infrage?“ und „Eignet sich Prüfmarke A für unser Team?“ können zur selben Beschaffungsentscheidung gehören. In der ersten Aufgabe ist die Aufnahme von A offen. In der zweiten haben Sie A bereits zum Gegenstand gemacht. Auch eine vollkommen sachliche Antwort auf die zweite Frage beantwortet deshalb nicht, ob A ohne diesen Hinweis berücksichtigt worden wäre.
Wir nennen die beiden Aufgaben hier O für offene Anbietersuche und M für gestützte Markenprüfung. Diese Kürzel sind eine eigene Redaktionshilfe. „Offen“ bedeutet dabei ohne Vorgabe der untersuchten Zielmarke im kontrollierbaren Eingabekontext. Der Name eines tatsächlich benötigten Drittsystems darf als begründete Anforderung stehen bleiben. Umgekehrt kann eine Frage ohne ausgeschriebenen Markennamen durch proprietäre Funktionsnamen bereits auf A hinweisen.
Der HELM-Ansatz des Stanford CRFM unterscheidet ausdrücklich Untersuchungsszenarien und Bewertungsmaße und legt Grenzen der Abdeckung offen. Der Grundlagenbeitrag von 2022 stützt diese allgemeine Trennung, validiert aber weder das folgende Markenprüfverfahren noch Aussagen über heutige Anbieter. Unsere Beispiele sind selbst entwickelte Planungsbeispiele; für diesen Artikel wurden keine Modellantworten erhoben.
Den Vergleich vor der ersten Antwort festlegen
Schreiben Sie zunächst auf, welche Entscheidung der Test unterstützen soll: Geht es um die Berücksichtigung in einer Auswahl oder um die Richtigkeit der Produktbeschreibung? Die NIST-Anleitung zur Versuchsplanung beginnt mit der Festlegung des Untersuchungsziels. Auf unseren Fall übertragen heißt das: erst Aufgabe und Bewertungsmaß definieren, danach den Wortlaut und den Ablauf festhalten. Die folgenden Regeln sind unsere praktische Anwendung dieses Prinzips.
Geben Sie jedem Kaufkontext eine Paar-ID. Zu ihr gehören ein O-Prompt und ein M-Prompt, dieselbe Käuferrolle, Region, Sprache, Anforderungen und derselbe Informationsstand. Die Aufgaben bleiben bewusst verschieden. Ein solches Paar ist keine bedeutungsgleiche Umformulierung und kein fertiger Nachweis für einen isolierten Markennamen-Effekt.
Begründen Sie die Auswahl der Kontexte aus bereits freigegebenen Kundenfragen oder dokumentierten Arbeitsaufgaben. Legen Sie Zielmarke, zulässige Schreibvarianten, ausgeschlossene Namensverwechslungen und die Auswertungsregeln vorab fest. Die drei folgenden Kontexte sind illustrative Beispiele, keine repräsentative Stichprobe und keine Empfehlung für eine bestimmte Mindestanzahl von Fragen.
Paar 01: Einstieg in eine Produktkategorie
O-Prompt: „Wir suchen ein CRM für ein zehnköpfiges Vertriebsteam in Deutschland. Wichtig sind eine gemeinsame Kontaktverwaltung, ein nachvollziehbarer Datenimport und transparente laufende Kosten. Welche Lösungen kommen infrage? Begründen Sie die Einordnung anhand nachvollziehbarer Quellen und benennen Sie Einschränkungen sowie fehlende Angaben.“
M-Prompt: „Wir suchen ein CRM für ein zehnköpfiges Vertriebsteam in Deutschland. Wichtig sind eine gemeinsame Kontaktverwaltung, ein nachvollziehbarer Datenimport und transparente laufende Kosten. Wie ist Prüfmarke A für diesen Bedarf einzuordnen? Begründen Sie die Einordnung anhand nachvollziehbarer Quellen und benennen Sie Einschränkungen sowie fehlende Angaben.“
„Prüfmarke A“ ist ein fiktiver Platzhalter und wird vor einer echten Erhebung durch die tatsächlich untersuchte Marke ersetzt. O kann Hinweise auf ihre Berücksichtigung liefern. M kann richtige Angaben, falsche Behauptungen oder unklare Voraussetzungen zur vorgegebenen Marke sichtbar machen. Das sind getrennte Ergebnisse, auch wenn beide Antworten denselben Kaufkontext betreffen.
Paar 02: Zusammenarbeit mit einem bestehenden System
O-Prompt: „Unser zehnköpfiges Vertriebsteam nutzt Microsoft 365 und benötigt ein CRM. Wir möchten Kontakte übernehmen und Termine im bestehenden Arbeitsablauf nutzen. Welche CRM-Lösungen kommen infrage? Unterscheiden Sie dokumentierte Funktionen, notwendige Zusatzprodukte und ungeklärte Voraussetzungen. Nennen Sie nachvollziehbare Quellen.“
M-Prompt: „Unser zehnköpfiges Vertriebsteam nutzt Microsoft 365 und benötigt ein CRM. Wir möchten Kontakte übernehmen und Termine im bestehenden Arbeitsablauf nutzen. Wie ist Prüfmarke A dafür einzuordnen? Unterscheiden Sie dokumentierte Funktionen, notwendige Zusatzprodukte und ungeklärte Voraussetzungen. Nennen Sie nachvollziehbare Quellen.“
Der Name Microsoft 365 beschreibt hier eine angenommene vorhandene Arbeitsumgebung; er ist kein Beleg für eine bestimmte Integration. In einem echten Test brauchen Sie einen dokumentierten Grund für diese Anforderung. Falls Sie gerade Microsoft als Zielmarke untersuchen, ist dieses Paar keine ungestützte Prüfung dieser Marke. „Ohne Zielmarke“ muss immer auf das tatsächlich untersuchte Unternehmen bezogen werden.
Paar 03: Einführung und späterer Wechsel
O-Prompt: „Ein zehnköpfiges Vertriebsteam in Deutschland möchte von Tabellen auf ein CRM wechseln. Für die Entscheidung sollen dokumentierter Import, Datenexport bei einem späteren Wechsel und verfügbare Einführungshilfen geprüft werden. Welche Lösungen kommen infrage? Trennen Sie belegte Möglichkeiten, Grenzen und offene Fragen und nennen Sie nachvollziehbare Quellen.“
M-Prompt: „Ein zehnköpfiges Vertriebsteam in Deutschland möchte von Tabellen auf ein CRM wechseln. Für die Entscheidung sollen dokumentierter Import, Datenexport bei einem späteren Wechsel und verfügbare Einführungshilfen geprüft werden. Wie ist Prüfmarke A dafür einzuordnen? Trennen Sie belegte Möglichkeiten, Grenzen und offene Fragen und nennen Sie nachvollziehbare Quellen.“
Ein Export kann vorhanden sein und trotzdem nur einen Teil der benötigten Daten umfassen. Prüfen Sie deshalb später die tatsächlich behauptete Funktion und ihren Geltungsbereich. Die bloße Nennung eines Exportfeatures ersetzt keine Eignungsprüfung. Ergänzen Sie nach dem Lesen einer günstigen Antwort nicht stillschweigend weitere Kriterien; Änderungen erhalten eine neue Prompt-Version.
Die Zielmarke darf nicht über den Gesprächskontext zurückkehren
Stellen Sie M und O nicht nacheinander im selben laufenden Gespräch. Für den empfohlenen Ablauf bekommt jede Ausführung einen getrennten, dokumentierten Kontext. Eine vorherige Markenbesprechung, eine angehängte Produktbroschüre oder eine eigene Website als Eingabe würde den Zweck von O verändern. Ein leeres Eingabefeld allein dokumentiert noch nicht, welche weiteren Informationen dem System zur Verfügung stehen.
Notieren Sie sichtbare Einstellungen und übermittelte Inhalte: System, angezeigter Modellstand, Suchmodus, Datum, Sprache, Region, Gesprächsverlauf, Dateien sowie verfügbare Angaben zu Erinnerung und persönlichen Anweisungen. Was sich nicht feststellen lässt, bleibt als unbekannt vermerkt. Behaupten Sie keine vollständig kontextfreie oder personalisierungsfreie Messung, wenn Sie dies nicht prüfen können.
Planen Sie Wiederholungen, Reihenfolge und den Umgang mit Fehlern vorab. Verteilen Sie beide Aufgaben möglichst ausgewogen über denselben Erhebungszeitraum; eine vorab festgelegte wechselnde oder zufällige Reihenfolge verhindert, dass absichtlich immer nur eine Aufgabe zuerst läuft. Sie beseitigt aber keine Änderungen des Systems oder andere unbekannte Einflüsse. Wiederholungen derselben Frage sind zudem nicht automatisch unabhängige neue Kaufkontexte.
Bewahren Sie den vollständigen Wortlaut, Antworttext und sichtbaren Status je Ausführung auf. Ersetzen Sie einen misslungenen Lauf nicht unbemerkt durch einen erfolgreichen. Das verlinkte Protokoll zu Suchmodus, Modell und Sitzung hilft, die Bedingungen genauer zu dokumentieren.
Getrennte Ergebnisnenner statt einer gemeinsamen Sichtbarkeitszahl
Für O können Sie den Nennungsanteil so definieren: Anzahl auswertbarer O-Antworten mit eindeutig zugeordneter Zielmarke geteilt durch alle O-Antworten, deren Nennung eindeutig mit Ja oder Nein beurteilt werden kann. Jede Antwort zählt höchstens einmal als Nennung, auch wenn sie den Namen mehrfach enthält. Unklare Zuordnungen werden mit ihrer Anzahl und Begründung separat ausgewiesen; sie zählen nicht als Nein. Legen Sie fest, ob der Antworttext oder zusätzlich sichtbare Quellenlisten untersucht werden; reine Quellenfunde gehören in ein separat bezeichnetes Feld.
Eine negative Erwähnung kann eine Nennung sein, ist aber keine Empfehlung. Erfassen Sie eine ausdrückliche Empfehlung getrennt nach einer dokumentierten Regel. Ihr Nenner umfasst die O-Antworten, deren Empfehlung eindeutig mit Ja oder Nein beurteilt werden kann; unklare Fälle bleiben separat. Die Nenner beider Kennzahlen können daher verschieden sein. Eine ordnungsgemäß beantwortete offene Frage ohne Zielmarke oder ohne passende Lösung kann eine echte Null für die Nennung ergeben. Ein Timeout, eine leere Antwort oder eine nicht auswertbare Verweigerung bekommt dagegen keinen erfundenen Nullwert.
Für M prüfen Sie die Produktbehauptungen: Zerlegen Sie die Antwort in einzeln prüfbare Aussagen und ordnen Sie diese anhand datierter Quellen als bestätigt, widerlegt oder nicht prüfbar ein. Notieren Sie zu jeder Einordnung die Fundstelle und gegebenenfalls eine fachliche Einschränkung. „Nicht prüfbar“ bedeutet weder falsch noch bestätigt. Eine höfliche Empfehlung und viele Quellenlinks garantieren keine korrekte Produktbeschreibung.
Berichten Sie zunächst die drei Aussagezahlen und ihre Summe. Wenn Sie zusätzlich einen Bestätigungsanteil berechnen, lautet der Nenner ausschließlich bestätigte plus widerlegte Aussagen; die ausgeschlossenen nicht prüfbaren Aussagen müssen daneben sichtbar bleiben. Dieser Anteil beschreibt die beurteilbaren Aussagen Ihrer Auswahl, keine allgemeine Modellgenauigkeit. Verschachtelte Aussagen werden vor dem Zählen getrennt, nicht nachträglich passend gewichtet. Ist der Nenner null, gibt es keine Prozentangabe. Das gilt ebenso für die O-Anteile.
Für jede Aufgabe nennen Sie außerdem geplante Ausführungen, tatsächlich erhaltene Antworten, auswertbare Antworten und Ausschlussgründe. Bei O gehört der jeweilige beurteilbare Nenner zu jeder Kennzahl. Eine Antwort ist die Einheit des O-Nennungsanteils; eine einzelne Behauptung ist die Einheit der M-Aussagenprüfung. Diese Nenner dürfen weder addiert noch als zwei austauschbare Sichtbarkeitswerte nebeneinandergestellt werden.
Zusammengehörige Antworten vergleichen und Lücken sichtbar lassen
Verknüpfen Sie Antworten über Paar-ID, Wiederholung und dokumentierte Bedingungen. Für einen direkten Vergleich innerhalb eines Paares verwenden Sie nur Durchläufe, in denen beide Aufgaben nach Ihren Regeln auswertbar sind. Berichten Sie daneben die Ergebnisse und Ausfälle aller geplanten Ausführungen je Aufgabe. Der Ausschluss unvollständiger Paare verändert die betrachtete Auswahl und kann die verbleibenden Beobachtungen verzerren.
Ein rein gedankliches Beispiel: O liefert eine verständliche Auswahl ohne A, während M einen Timeout hat. Sie haben dann eine auswertbare O-Antwort ohne Zielmarke und keine M-Bewertung. Daraus wird weder ein vollständiges Vergleichspaar noch ein Beleg dafür, dass das System A falsch versteht. Dieses Beispiel erläutert die Buchführung und enthält keine gemessenen Ergebnisse.
Auch die Bewertung selbst kann Unterschiede erzeugen. Hua und Mitautoren zeigen in ihrer EMNLP-Arbeit von 2025 für die untersuchten Benchmarks, dass starre Antwortauswertung einen Teil scheinbarer Prompt-Empfindlichkeit erklären kann. Prüfen Sie daher Namensvarianten und sinngleiche Aussagen, statt ausschließlich nach Zeichenfolgen zu zählen. Das Papier belegt keine bestimmte Fehlerquote dieses Markenverfahrens und ersetzt keine Prüfung Ihrer eigenen Kodierung.
Was aus dem Ergebnis folgen darf
Wird die Marke in O nicht berücksichtigt, in M aber sachlich eingeordnet, haben Sie zwei Beobachtungen unter unterschiedlichen Aufgaben. Das kann Anlass sein, die Auswahlkontexte, die fachliche Passung und die öffentlich belegten Eigenschaften genauer zu prüfen. Es beweist weder Unsichtbarkeit im gesamten Markt noch einen bestimmten Fehler der Website. Bei einer falschen M-Aussage prüfen Sie zunächst deren Inhalt, Quelle und Aktualität, bevor Sie eine Maßnahme empfehlen.
Die Differenz zwischen O und M ist kein Bekanntheitszuwachs und keine gemessene Wirkung einer Marketingmaßnahme. Ihre selbst gewählten Fragen sagen auch nicht, wie häufig Interessenten solche Fragen stellen. Tatsächlich beobachtete Suchanfragen, Kundenbefragungen und ein geplantes KI-Antwortset sind unterschiedliche Datenquellen mit eigenen Auswahlgrenzen.
Die ausfüllbare TXT-Vorlage unter den Quellen bündelt den Plan und die getrennte Ergebnisbuchführung. Halten Sie abschließend fest, welche Frage beantwortet wurde, welche Beobachtungen vorliegen und was weiterhin unbekannt ist. Für Zeitvergleiche behalten Sie innerhalb jeder Aufgabe den Wortlaut und die Bewertungsregeln bei oder markieren einen Versionswechsel. So bleiben offene Auswahl und gestützte Produktprüfung dauerhaft auseinanderzuhalten.
Kurz zusammengefasst
Die wichtigsten Punkte
- Offene Anbietersuche und gestützte Markenprüfung beantworten unterschiedliche, jeweils legitime Fragen.
- Verbinden Sie die Aufgaben über denselben Kaufkontext und dokumentieren Sie beide Wortlaute vor der Erhebung.
- Prüfen Sie die Abwesenheit der Zielmarke im verfügbaren Gesamtkontext, nicht nur im letzten Fragesatz.
- Nennungen beziehen sich auf auswertbare offene Antworten; die Produktprüfung bezieht sich auf einzelne Aussagen und deren Belegstatus.
- Lücken, unvollständige Paare und nicht prüfbare Aussagen bleiben sichtbar. Die Ergebnisse belegen weder Suchvolumen noch Marktbekanntheit.
Quellen und weiterführende Grundlagen
Die verlinkten Primärquellen bieten fachliche Grundlagen und weiterführenden Kontext. Handlungsempfehlungen und Beispiele im Beitrag sind redaktionelle Einordnungen.
- NIST/SEMATECH: Untersuchungsziele vor der Versuchsplanung festlegenÖffnet in neuem Tab
- Stanford CRFM / Bommasani, Liang und Lee (2022): Language Models are Changing AI – The Need for Holistic EvaluationÖffnet in neuem Tab
- Hua et al. (EMNLP 2025): Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMsÖffnet in neuem Tab
- Transparion: Eigene Planungs- und Auswertungsvorlage für offene und gestützte KI-Tests (TXT, 21.09.2026)Öffnet in neuem Tab
