KI-Performance
KI-Sichtbarkeit von Marken im Wettbewerbsvergleich
KI-Performance bezeichnet die Sichtbarkeit einer Marke in den Antworten generativer KI-Systeme. Die KI-Performance-Studien von research tools messen diese Sichtbarkeit branchenweise in zehn Large Language Models und beantworten damit die zentrale Frage der Generative Engine Optimization (GEO): Welche Marken empfiehlt die KI und warum? Erfasst werden das Gesamtranking der Marken und Firmen, ihre Sichtbarkeit je Sprachmodell, nach Produktkategorien und Anbietergruppen, die Konzentration der KI-Performance, die von den Modellen zitierten Quellen sowie Tonalität und inhaltliche Positionierung der führenden Marken.
In der neuen Reihe KI-Performance sind bisher vier Marktstudien zu den Branchen Arzneimittel, Versicherungen, Schuhe sowie Kaffee und Kaffeemaschinen erschienen – mit jeweils 314 bis 779 in den KI-Antworten sichtbaren Marken.
Was KI-Performance-Studien messen
Verbraucherinnen und Verbraucher bereiten Kauf- und Abschlussentscheidungen zunehmend über KI-gestützte Such- und Assistenzsysteme vor. Wer dort nicht genannt wird, fällt aus der Vorauswahl heraus, noch bevor die eigene Website erreicht wird. Die Studien erfassen für jede Branche, welche Marken in den KI-Antworten auftauchen, an welcher Position sie genannt werden und worauf sich die Modelle dabei stützen.
Forschungsdesign der Studienreihe KI-Performance
Analysiert wird die Markenpräsenz in den zehn Large Language Models ChatGPT, Claude, Copilot, DeepSeek, Gemini, Grok, LLaMA, Mistral, Perplexity und Qwen. Jedes Modell erhält 50 realitätsnah formulierte, deutschsprachige Nutzeranfragen zu 14 bis 15 Produktkategorien der jeweiligen Branche, sodass je Studie 500 vollständige KI-Antworten in die Auswertung eingehen. Die Anfragen bilden typische Suchintentionen ab, nennen bewusst keine Marken und werden in einem mehrstufigen Verfahren entwickelt, fachlich geprüft und gegen reale Nutzerfragen validiert.
Jede genannte Marke wird nach ihrer Position in der Antwort mit absteigend elf bis einem Punkt bewertet, da zuerst genannte Marken die größte Aufmerksamkeit erhalten. Je Studie sind bis zu 5.500 KI-Performance-Punkte erreichbar, die zehn Modelle gehen gleichgewichtet ein. Neben Rankings je Modell, Produktkategorie und 10 bis 13 Anbietergruppen zeigen Lorenzkurven die Konzentration der KI-Performance, Quellenprofile, welche Websites die Sichtbarkeit einer Marke tragen, und die Tonalitätsanalyse, ob die Modelle positiv empfehlend, sachlich informierend oder kritisch hinweisend über die Marken sprechen. Korrespondenzanalyse und Konzentrationsmatrix machen sichtbar, welche Modelle welche Marken bevorzugen. Die Studien liefern damit die Datengrundlage für eine differenzierte Content-, PR- und Quellenstrategie im Bereich Generative Engine Optimization (GEO) beziehungsweise Large Language Model Optimization (LLMO).
Folgende Studien sind bisher erschienen:
Studie KI-Performance Arzneimittel 2026

Die Studie zeigt, wie sichtbar Marken aus dem Segment Arzneimittel in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 779 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.
148 Seiten, 2.000 Euro zzgl. MwSt.
Studie KI-Performance Versicherungen 2026

Die Studie zeigt, wie sichtbar Marken aus dem Segment Versicherungen in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 314 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.
121 Seiten, 2.000 Euro zzgl. MwSt.
Studie KI-Performance Schuhe 2026

Die Studie zeigt, wie sichtbar Marken aus dem Segment Schuhe in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 532 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.
126 Seiten, 2.000 Euro zzgl. MwSt.
Studie KI-Performance Kaffee und Kaffeemaschinen 2026

Die Studie zeigt, wie sichtbar Marken aus dem Segment Kaffee und Kaffeemaschinen in KI‑gestützten Such- und Assistenzsystemen sind. Auf Basis von jeweils 50 realitätsnahen Nutzeranfragen an zehn Large Language Models analysiert sie die Präsenz von insgesamt 746 Marken. Enthalten sind Rankings und Detailauswertungen über alle LLMs hinweg sowie differenzierte Analysen nach LLM, Produktkategorien, Anbietergruppen, Quellen und Tonalität.
128 Seiten, 2.000 Euro zzgl. MwSt.
weitere Studien
Häufige Fragen zu den Studien
Kritische Rückfragen aus Gesprächen mit Herstellern, Versicherern, Apotheken, Händlern und Agenturen – branchenübergreifend und offen beantwortet.
Portale, Händler, Medien und Fachquellen konkurrieren zwar um Sichtbarkeit, sind aber keine direkten Wettbewerber der Hersteller. Ist das eine Verzerrung?
- Erfasst wird, was die Modelle auf eine Verbraucherfrage ausgeben. Nennt ein Modell ein Vergleichsportal, eine Versandapotheke, einen Händler oder ein Verbrauchermedium, besetzt dieses real den Platz, den sonst eine Herstellermarke hätte. Aus Nutzersicht ist das der Wettbewerb um Aufmerksamkeit.
- Jede Studie ordnet alle Marken branchenspezifischen Anbietergruppen zu und weist für jede Gruppe ein eigenes Ranking aus. Der Vergleich innerhalb der eigenen Gruppe ist damit jederzeit möglich.
- Die Anteile unterscheiden sich je Branche deutlich: In der Versicherungsstudie stellen Versicherer im engeren Sinn 70,6 % der Punkte, in der Arzneimittelstudie entfallen 58,5 % auf Arzneimittelhersteller – der Rest verteilt sich auf Apotheken, Medien, Fachinstitutionen, Portale und weitere Anbieter.
- Der eigentliche Erkenntniswert liegt in der Mischung: Wenn Portale, Medien oder Institutionen im Ranking weit vorn liegen und zugleich zu den meistzitierten Quellen gehören, ist das das strategische Signal: Wer in der KI-Antwort vorkommen will, muss in deren Quellen vorkommen.
Werden Spezialisten mit schmalem Sortiment benachteiligt, weil sie nicht in allen Kategorien punkten können?
Welchen konkreten Nutzen hat ein Unternehmen, das nicht unter den Top-Anbietern liegt?
- Nennposition statt Punktzahl. Der Ø-Rang zeigt, wie weit vorn eine Marke steht, wenn sie genannt wird. Marken außerhalb der Top 10 erreichen hier teils bessere Werte als etablierte Top-10-Marken – in der Versicherungsstudie hat AGILA mit Ø-Rang 2,4 die beste Nennposition aller Marken mit mindestens 20 Nennungen. Das ist kein Überzeugungs-, sondern ein Anlassproblem.
- Modell-Blindspots. Für jede Marke ist ausgewiesen, in welchen Modellen sie stark, schwach oder gar nicht vertreten ist. Selbst Top-10-Marken fehlen teils in einzelnen Modellen vollständig, während sie in anderen zu den stärksten zählen – jeweils eine konkrete, priorisierbare Lücke.
- Quellenprofil. Je Marke wird aufgeschlüsselt, welcher Anbietertyp die Sichtbarkeit trägt. Die Spannweite ist groß: Bei manchen Marken stammen drei Viertel der Quellenverweise von der eigenen Website, bei anderen tragen Portale, Händler oder Medien ein Drittel und mehr. Daraus folgt unmittelbar, an welchem Hebel zu arbeiten ist.
- Kategorie-Benchmark. Vergleich innerhalb der eigenen Produktkategorie und Anbietergruppe statt gegen den Gesamtmarkt.
Welchen Mehrwert bieten die Studien gegenüber einer eigenen Recherche mit den LLMs – außer Zeitersparnis?
- Wettbewerbsvergleich. Die eigene Abfrage zeigt nur die eigene Marke. Die Studien liefern die Position relativ zu allen übrigen erfassten Marken der Branche – je Studie zwischen 314 und 779. Ohne Vergleichsbasis ist ein Einzelbefund nicht interpretierbar.
- Systematik statt Stichprobe. 50 methodisch konstruierte Anfragen über typische Suchintentionen und 14 bis 15 Produktkategorien statt Ad-hoc-Fragen, deren Formulierung das Ergebnis bereits mitbestimmt.
- Neutralität. Eigene Abfragen laufen typischerweise in personalisierten Accounts mit Verlauf und mit Markenbias in der Fragestellung. Die Studien arbeiten mit neutralen Zugängen und markenfreien Anfragen.
- Zehn Modelle parallel. Inklusive der Modelle, die man selbst nicht nutzt, die Kunden aber nutzen – und inklusive der Erkenntnis, welche Modelle die eigene Marke ignorieren.
- Quellenanalyse. Die eigentliche Handlungsebene: je Studie mehrere Tausend Zitationen über Hunderte Basisquellen – in der Arzneimittelstudie 5.752 Zitationen über 873 Basisquellen, manuell nicht darstellbar.
- Auswertungstiefe. Sentiment- und Positionierungsanalyse, Korrespondenzanalyse, Konzentrationsanalyse, Anbietergruppen- und Kategoriematrizen auf Basis eines Textkorpus von mehreren Zehntausend Wörtern je Studie.
- Objektivität und Zitierfähigkeit. Unabhängig erstellt, methodisch dokumentiert, extern belastbar – verwendbar gegenüber Vorstand, Vertrieb und Presse.
Sind die Ergebnisse der einzelnen Branchenstudien miteinander vergleichbar?
- Vergleichbar sind strukturelle Kennzahlen wie die Konzentration der KI-Performance, die Anteile der Anbietergruppen, die Rolle der zitierten Quellen oder die Tonalitätsverteilung. So zeigt sich etwa, dass die KI-Präsenz im Arzneimittelmarkt breit gestreut ist: Auf die Top-10-Marken entfallen dort nur rund 15 % der Punkte.
- Branchenspezifisch sind dagegen Produktkategorien und Anbietergruppen. Absolute Punktwerte und Ränge einzelner Marken sind deshalb innerhalb einer Studie direkt vergleichbar, zwischen Branchen nur in Relation zur jeweiligen Marktstruktur.
Warum zählen alle Modelle gleich, obwohl ChatGPT dominiert?
Sind 50 Anfragen nicht sehr wenig?
- Kategoriensystem vorab festgelegt. Die Kernkategorien werden nicht von der KI bestimmt, sondern aus einer Vorrecherche bei führenden Anbietern und aus früheren Studien abgeleitet. Die KI darf maximal zwei weitere Kategorien vorschlagen und begründen. Die Struktur ist gesetzt, nicht generiert.
- Generierung mit steuerndem Prompt. Vorgegeben sind realistische Nutzungsanlässe, ein Mix aus Stichwortanfragen und ausformulierten Fragen sowie ein kleinerer Anteil kritischer Töne.
- Fachliche Kontrolle und Überarbeitung. Der KI-Output ist der Entwurf, nicht das Ergebnis: Jede Anfrage wird auf Basis der Marktforschungs- und Branchenexpertise geprüft, überarbeitet oder verworfen.
- Externe Validierung (Reverse Engineering). Die Formulierungen werden gegen nutzergenerierte Inhalte auf Verbraucherportalen, in Foren und auf Bewertungsplattformen gespiegelt: Sprechen echte Verbraucher so? Kommen diese Anliegen dort tatsächlich vor? Erst danach geht eine Anfrage ins Feld.



