KI-Performance

KI-Performance-Studien: Markensichtbarkeit in Large Language Models

KI-Sichtbarkeit von Marken im Wettbewerbsvergleich

KI-Performance bezeichnet die Sichtbarkeit einer Marke in den Antworten generativer KI-Systeme. Die KI-Performance-Studien von research tools messen diese Sichtbarkeit branchenweise in zehn Large Language Models und beantworten damit die zentrale Frage der Generative Engine Optimization (GEO): Welche Marken empfiehlt die KI und warum? Erfasst werden das Gesamtranking der Marken und Firmen, ihre Sichtbarkeit je Sprachmodell, nach Produktkategorien und Anbietergruppen, die Konzentration der KI-Performance, die von den Modellen zitierten Quellen sowie Tonalität und inhaltliche Positionierung der führenden Marken.

In der neuen Reihe KI-Performance sind bisher vier Marktstudien zu den Branchen Arzneimittel, Versicherungen, Schuhe sowie Kaffee und Kaffeemaschinen erschienen – mit jeweils 314 bis 779 in den KI-Antworten sichtbaren Marken.

Was KI-Performance-Studien messen

Verbraucherinnen und Verbraucher bereiten Kauf- und Abschlussentscheidungen zunehmend über KI-gestützte Such- und Assistenzsysteme vor. Wer dort nicht genannt wird, fällt aus der Vorauswahl heraus, noch bevor die eigene Website erreicht wird. Die Studien erfassen für jede Branche, welche Marken in den KI-Antworten auftauchen, an welcher Position sie genannt werden und worauf sich die Modelle dabei stützen.

Forschungsdesign der Studienreihe KI-Performance

Analysiert wird die Markenpräsenz in den zehn Large Language Models ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, LLaMA, Mistral, Perplexity und Qwen. Jedes Modell erhält 50 realitätsnah formulierte, deutschsprachige Nutzeranfragen zu 14 bis 15 Produktkategorien der jeweiligen Branche, sodass je Studie 500 vollständige KI-Antworten in die Auswertung eingehen. Die Anfragen bilden typische Suchintentionen ab, nennen bewusst keine Marken und werden in einem mehrstufigen Verfahren entwickelt, fachlich geprüft und gegen reale Nutzerfragen validiert.

Jede genannte Marke wird nach ihrer Position in der Antwort mit absteigend elf bis einem Punkt bewertet, da zuerst genannte Marken die größte Aufmerksamkeit erhalten. Je Studie sind bis zu 5.500 KI-Performance-Punkte erreichbar, die zehn Modelle gehen gleichgewichtet ein. Neben Rankings je Modell, Produktkategorie und 10 bis 13 Anbietergruppen zeigen Lorenzkurven die Konzentration der KI-Performance, Quellenprofile, welche Websites die Sichtbarkeit einer Marke tragen, und die Tonalitätsanalyse, ob die Modelle positiv empfehlend, sachlich informierend oder kritisch hinweisend über die Marken sprechen. Korrespondenzanalyse und Konzentrationsmatrix machen sichtbar, welche Modelle welche Marken bevorzugen. Die Studien liefern damit die Datengrundlage für eine differenzierte Content-, PR- und Quellenstrategie im Bereich Generative Engine Optimization (GEO) beziehungsweise Large Language Model Optimization (LLMO).

Folgende Studien sind bisher erschienen:

Die Studie zeigt, wie sichtbar Marken aus dem Segment Arzneimittel in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 779 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.

148 Seiten, 2.000 Euro zzgl. MwSt.

zur Studie KI-Performance Arzneimittel 2026

Titelbild der Studie KI-Performance Versicherungen 2026

Die Studie zeigt, wie sichtbar Marken aus dem Segment Versicherungen in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 314 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.

121 Seiten, 2.000 Euro zzgl. MwSt.

zur Studie KI-Performance Versicherungen 2026

Titelbild der Studie KI-Performance Schuhe 2026

Die Studie zeigt, wie sichtbar Marken aus dem Segment Schuhe in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 532 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.

126 Seiten, 2.000 Euro zzgl. MwSt.

zur Studie KI-Performance Schuhe 2026

Titelbild der Studie KI-Performance Kaffee und Kaffeemaschinen 2026

Die Studie zeigt, wie sichtbar Marken aus dem Segment Kaffee und Kaffeemaschinen in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 746 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.

128 Seiten, 2.000 Euro zzgl. MwSt.

zur Studie KI-Performance Kaffee und Kaffeemaschinen 2026

Häufige Fragen zu den Studien

Kritische Rückfragen aus Gesprächen mit Herstellern, Versicherern, Apotheken, Händlern und Agenturen – branchenübergreifend und offen beantwortet.

Portale, Händler, Medien und Fachquellen konkurrieren zwar um Sichtbarkeit, sind aber keine direkten Wettbewerber der Hersteller. Ist das eine Verzerrung?
Nein – es ist eine bewusste Abbildung der Realität, und die Studien liefern die Trennung gleich mit.
  • Erfasst wird, was die Modelle auf eine Verbraucherfrage ausgeben. Nennt ein Modell ein Vergleichsportal, eine Versandapotheke, einen Händler oder ein Verbrauchermedium, besetzt dieses real den Platz, den sonst eine Herstellermarke hätte. Aus Nutzersicht ist das der Wettbewerb um Aufmerksamkeit.
  • Jede Studie ordnet alle Marken branchenspezifischen Anbietergruppen zu und weist für jede Gruppe ein eigenes Ranking aus. Der Vergleich innerhalb der eigenen Gruppe ist damit jederzeit möglich.
  • Die Anteile unterscheiden sich je Branche deutlich: In der Versicherungsstudie stellen Versicherer im engeren Sinn 70,6 % der Punkte, in der Arzneimittelstudie entfallen 58,5 % auf Arzneimittelhersteller – der Rest verteilt sich auf Apotheken, Medien, Fachinstitutionen, Portale und weitere Anbieter.
  • Der eigentliche Erkenntniswert liegt in der Mischung: Wenn Portale, Medien oder Institutionen im Ranking weit vorn liegen und zugleich zu den meistzitierten Quellen gehören, ist das das strategische Signal: Wer in der KI-Antwort vorkommen will, muss in deren Quellen vorkommen.
Werden Spezialisten mit schmalem Sortiment benachteiligt, weil sie nicht in allen Kategorien punkten können?
Für das Gesamtranking trifft das strukturell zu – deshalb ist es nicht die einzige Auswertung. Jede Studie weist Rankings je Produktkategorie aus, und dort gewinnen häufig die Spezialisten: In der Arzneimittelstudie stehen acht der 14 Kategoriesieger außerhalb der Gesamt-Top-10, überwiegend Marken mit klar fokussiertem Indikationsgebiet; auch in der Versicherungsstudie erreichen Spezialisten die höchsten Kategoriekonzentrationen, nicht die Breitanbieter. Ein Spezialanbieter misst sich also an seiner Kategorie, nicht am Gesamtranking. Zusätzlich stellt die Konzentrationsmatrix Breiten- und Tiefenstrategie explizit gegenüber.
Welchen konkreten Nutzen hat ein Unternehmen, das nicht unter den Top-Anbietern liegt?
Vier Auswertungen sind vom Gesamtrang unabhängig:
  1. Nennposition statt Punktzahl. Der Ø-Rang zeigt, wie weit vorn eine Marke steht, wenn sie genannt wird. Marken außerhalb der Top 10 erreichen hier teils bessere Werte als etablierte Top-10-Marken – in der Versicherungsstudie hat AGILA mit Ø-Rang 2,4 die beste Nennposition aller Marken mit mindestens 20 Nennungen. Das ist kein Überzeugungs-, sondern ein Anlassproblem.
  2. Modell-Blindspots. Für jede Marke ist ausgewiesen, in welchen Modellen sie stark, schwach oder gar nicht vertreten ist. Selbst Top-10-Marken fehlen teils in einzelnen Modellen vollständig, während sie in anderen zu den stärksten zählen – jeweils eine konkrete, priorisierbare Lücke.
  3. Quellenprofil. Je Marke wird aufgeschlüsselt, welcher Anbietertyp die Sichtbarkeit trägt. Die Spannweite ist groß: Bei manchen Marken stammen drei Viertel der Quellenverweise von der eigenen Website, bei anderen tragen Portale, Händler oder Medien ein Drittel und mehr. Daraus folgt unmittelbar, an welchem Hebel zu arbeiten ist.
  4. Kategorie-Benchmark. Vergleich innerhalb der eigenen Produktkategorie und Anbietergruppe statt gegen den Gesamtmarkt.
Welchen Mehrwert bieten die Studien gegenüber einer eigenen Recherche mit den LLMs – außer Zeitersparnis?
Sieben Punkte, die eine Eigenrecherche prinzipiell nicht leisten kann:
  1. Wettbewerbsvergleich. Die eigene Abfrage zeigt nur die eigene Marke. Die Studien liefern die Position relativ zu allen übrigen erfassten Marken der Branche – je Studie zwischen 314 und 779. Ohne Vergleichsbasis ist ein Einzelbefund nicht interpretierbar.
  2. Systematik statt Stichprobe. 50 methodisch konstruierte Anfragen über typische Suchintentionen und 14 bis 15 Produktkategorien statt Ad-hoc-Fragen, deren Formulierung das Ergebnis bereits mitbestimmt.
  3. Neutralität. Eigene Abfragen laufen typischerweise in personalisierten Accounts mit Verlauf und mit Markenbias in der Fragestellung. Die Studien arbeiten mit neutralen Zugängen und markenfreien Anfragen.
  4. Zehn Modelle parallel. Inklusive der Modelle, die man selbst nicht nutzt, die Kunden aber nutzen – und inklusive der Erkenntnis, welche Modelle die eigene Marke ignorieren.
  5. Quellenanalyse. Die eigentliche Handlungsebene: je Studie mehrere Tausend Zitationen über Hunderte Basisquellen – in der Arzneimittelstudie 5.752 Zitationen über 873 Basisquellen, manuell nicht darstellbar.
  6. Auswertungstiefe. Sentiment- und Positionierungsanalyse, Korrespondenzanalyse, Konzentrationsanalyse, Anbietergruppen- und Kategoriematrizen auf Basis eines Textkorpus von mehreren Zehntausend Wörtern je Studie.
  7. Objektivität und Zitierfähigkeit. Unabhängig erstellt, methodisch dokumentiert, extern belastbar – verwendbar gegenüber Vorstand, Vertrieb und Presse.
Hinzu kommt die Vergleichbarkeit im Zeitverlauf: Weil Design und Prompts dokumentiert und wiederholbar sind, lässt sich die Entwicklung über Folgestudien messen – die entscheidende Größe in einem Feld, das sich monatlich verändert.
Sind die Ergebnisse der einzelnen Branchenstudien miteinander vergleichbar?
Methodisch ja: Alle Studien der Reihe folgen demselben Forschungsdesign – dieselben zehn Sprachmodelle, 50 Anfragen je Modell, identische Punktevergabe mit maximal 5.500 erreichbaren Punkten und dieselben Analysebausteine.
  • Vergleichbar sind strukturelle Kennzahlen wie die Konzentration der KI-Performance, die Anteile der Anbietergruppen, die Rolle der zitierten Quellen oder die Tonalitätsverteilung. So zeigt sich etwa, dass die KI-Präsenz im Arzneimittelmarkt breit gestreut ist: Auf die Top-10-Marken entfallen dort nur rund 15 % der Punkte.
  • Branchenspezifisch sind dagegen Produktkategorien und Anbietergruppen. Absolute Punktwerte und Ränge einzelner Marken sind deshalb innerhalb einer Studie direkt vergleichbar, zwischen Branchen nur in Relation zur jeweiligen Marktstruktur.
Warum zählen alle Modelle gleich, obwohl ChatGPT dominiert?
Das ist eine bewusste Setzung: Gemessen wird KI-Sichtbarkeit als Systemphänomen. Belastbare deutsche Nutzeranteile je Modell liegen nicht vor, jede Gewichtung wäre daher eine eigene Setzung mit eigener Angreifbarkeit. Die Einzelrankings je Modell liegen jeder Studie bei – jeder Leser kann auf dieser Basis selbst gewichten.
Sind 50 Anfragen nicht sehr wenig?
Die Analyseeinheit ist nicht die Anfrage, sondern die Response: 500 vollständige Antworten je Studie mit mehreren Zehntausend ausgewerteten Wörtern. Jede Produktkategorie ist mehrfach abgedeckt. Ziel ist keine Repräsentativität im Bevölkerungssinn, sondern die systematische Abbildung typischer Suchintentionen – von der ersten Orientierung über Vergleich und Kaufentscheidung bis zur Anwendung. Marken, Hersteller und Händler werden in den Anfragen bewusst nicht genannt. Entscheidend ist zudem, wie die Anfragen entstehen – in vier Stufen:
  1. Kategoriensystem vorab festgelegt. Die Kernkategorien werden nicht von der KI bestimmt, sondern aus einer Vorrecherche bei führenden Anbietern und aus früheren Studien abgeleitet. Die KI darf maximal zwei weitere Kategorien vorschlagen und begründen. Die Struktur ist gesetzt, nicht generiert.
  2. Generierung mit steuerndem Prompt. Vorgegeben sind realistische Nutzungsanlässe, ein Mix aus Stichwortanfragen und ausformulierten Fragen sowie ein kleinerer Anteil kritischer Töne.
  3. Fachliche Kontrolle und Überarbeitung. Der KI-Output ist der Entwurf, nicht das Ergebnis: Jede Anfrage wird auf Basis der Marktforschungs- und Branchenexpertise geprüft, überarbeitet oder verworfen.
  4. Externe Validierung (Reverse Engineering). Die Formulierungen werden gegen nutzergenerierte Inhalte auf Verbraucherportalen, in Foren und auf Bewertungsplattformen gespiegelt: Sprechen echte Verbraucher so? Kommen diese Anliegen dort tatsächlich vor? Erst danach geht eine Anfrage ins Feld.
Zur Qualitätssicherung gehören außerdem die vollständige Volltext-Speicherung aller 500 Responses, die manuelle Kontrolle und Korrektur der maschinellen Markenerkennung (dokumentiert in eigenen Dateien), die fachliche Prüfung aller Ergebnisse sowie ein standardisiertes Auswertungsprotokoll für Tokenisierung, Wortnormalisierung und Tonalitätskategorisierung im Satzkontext.