Eigener ChatGPT Index und was das für SEO bedeutet: SEO im Ohr - Folge 424

Show notes

Sichtbarkeit in Google und Bing alleine ist keine Garantie mehr, um auch in ChatGPT angezeigt zu werden. ChatGPT setzt nach aktuellen Erkenntnissen immer mehr auf einen eigenen Index mit dem Namen Labrador. Passend dazu sollte man auch die neuen Freshness Windows kennen, mit denen ChatGPT die Aktualität von Dokumenten für seine Antworten auswählt.

Google testet einen "Continue"-Button, den man drücken muss, um nach einer Suchanfrage die Ergebnisse zu sehen. Auch das ist eine mögliche Maßnahme gegen das automatische Scrapen von Suchergebnissen.

Es gibt neue Details darüber, welche Suchedaten Google in Europa seinen Wettbewerbern zur Verfügung stellen muss und wer sich für solche Daten qualifizieren kann.

Für manche Suchanfragen lädt Google jetzt den AI Mode automatisch. Das ist ein weiteres Anzeichen für die schrittweise Umstellung der kompletten Suche in Richtung KI.

Show transcript

00:00:00: Hallo und herzlich willkommen zu einer neuen Ausgabe von Seo im Ohr, eurem Seeo-Podcast hier auf Seeo Südwest wie immer mit den aktuellsten Seeo News der Woche.

00:00:25: Ja in dieser Woche da haben wir gleich zweimal Chat GPT dabei nämlich zum einen hat Chat GPTI einen eigenen Index und wir sprechen darüber was das für Websites und für SEO bedeutet Und wir sprechen auch über die neuen Freshness-Windows, die Chatchapity anwendet bei Suchanfragen.

00:00:44: Die abgesetzt werden.

00:00:46: Außerdem ergreift Google Maßnahmen gegen Scraper und zeigt Zuergebnisse erst nach dem Klick auf einen Button an – zumindest im Test – und das Google European Search Data Set Licensing Program.

00:01:01: so muss Google Suchdaten offenlegen in Europa.

00:01:04: Auch sehr interessant!

00:01:05: Und schließlich noch etwas zum Google AI-Mode, denn der lädt jetzt automatisch für bestimmte Suchanfragen.

00:01:13: Ja all das sind diese Ausgaben von Siri im Ohr und ich freu mich natürlich sehr dass ihr dabei seid.

00:01:18: Fangen wir gleich mal an mit ChatGPT eigenen Index den ChatGPT verwendet.

00:01:25: Man konnte ja bisher davon ausgehen, dass ChatGpT zumindest einen erheblichen Teil seiner Web-Ergebnisse bei Bing oder Google abruft oder eben aus Daten die auf Ergebnissen von Bing und Google basieren.

00:01:41: Das war recht bequem also auch aus Seosicht Denn wer in den Suchmaschinen gute Rankings erzielte der tauchte sehr wahrscheinlich auch in ChatGpt.

00:01:51: Es ist aber gut möglich, dass diese Zeiten bereits vorbei sind.

00:01:55: Denn OpenAI betreibt sehr wahrscheinlich bereits seit Jahren schon einen eigenen Suchindex mit dem Namen Labrador und ich bin da auf eine Recherche gestoßen von Tomek Rutki vom Peak AI und außerdem auch auf eine Datenauswertung der französischen Agentur Resonéo die ich bei SearchEndland gefunden hatte liefern doch recht klare Indizien für einen eigenen Index bei ChatGPT.

00:02:28: Gucken wir zunächst mal ein bisschen zurück, und zwar zwischen dem XXI.

00:02:31: Mai und dem XXII.

00:02:33: Juli dieses Jahres.

00:02:34: Da tauchte im Datenstrom von ChatGBt ein Feld namens Result Source auf.

00:02:40: Und das trugen nur vier Werte nämlich Labrador, Bright, Oxylabs und Serb.

00:02:45: Die letzten drei stehen für externe Dienstleister.

00:02:52: dementsprechend OpenAI's eigener Index.

00:02:55: Das Ganze verschwand dann im Juli wieder aus dem Stream, aber nichtsdestotrotz kann man da schon einiges rauslesen bzw.

00:03:02: es gibt auch neue Erkenntnisse dazu.

00:03:04: Es steckt nämlich dahinter eine Reihe getrennter Indizes die ja jeder auf einen eigenen Inhaltstyp zugeschnitten sind.

00:03:12: wir haben zum Beispiel einen allgemeinen Webindex für PDF Dateien für YouTube, für Wikipedia, für lokale Ergebnisse und so weiter Und das wird für jedes Dokument wird dann gespeichert, was eigentlich auch Google in seinem Index ablegt.

00:03:28: Nämlich der Seiteninhalt des Crawl Datum und auch des Veröffentlichungsdatums.

00:03:33: Jetzt stellt sich natürlich die Frage wie kommt man darauf dass das ein eigener Index ist?

00:03:39: Wie wird er eingesetzt?

00:03:41: Zunächst einmal was darauf hindeutet sind mehrere Dinge.

00:03:46: OpenAI hat verschiedene Stellen ausgeschrieben zum Beispiel einen für Engineering Manager Online Data Systems und da wird ein Team genannt, dass die zentralen Datenbank- und Indexdienste Hinterchat GPT baut und betreibt.

00:03:59: Und das über mehrere Regionen und Clouds hinweg im Exabyte Bereich.

00:04:03: Nur mal kurz was ist ein Exabyte?

00:04:04: Das sind tausend Peterbyte.

00:04:07: Ein Peterbyte sind tausend Terabyte und ein Terabyte sind Tausend Gigabyte, da könnt ihr euch so ungefähr mal die Größenordnung vorstellen.

00:04:14: Dann gibt es noch eine weitere Ausschreibung, die richtet sich an Entwickler für Indexierungssysteme, Retrieval Pipelines & Serving Layer.

00:04:21: Und das sind auch Techniken, die man eben braucht zur klassischen Information Retrievel Aufgaben für Indexierung Also alles Dinge, die ja auch Google schon lange betreibt und zusammen mit im Beddings ergibt das genau den Aufbau.

00:04:39: den man für die sogenannte riskprocal Ranked Fusion braucht.

00:04:43: Und dieses Verfahren ist auch dokumentiert in einem Beitrag von Mithjan Jeselyurt, das habe ich euch auch verlinkt im entsprechenden Beitrag und daraus ergibt sich dann eigentlich ein ganz rundes Bild wie dann möglicherweise Chatchi Pity schon arbeitet bzw.

00:05:00: in welche Richtung die Entwicklung gehen kann.

00:05:02: Da gibt es noch Gerichtsdaten aus denen man ablesen kann wann OpenAI mit dem Aufbau eines eigenen Indexes begonnen hat.

00:05:08: Und Nick Turley, der bei OpenAI für Chechepetier verantwortlich war, sagt auch im Google Cartel-Verfahren unter Eid aus dass die Suchdaten der Nicht-Google Partner erhebliche Qualitätsprobleme aufgewiesen haben sollen und OpenAI habe mit Google entsprechende Zusammenarbeit angestrebt, aber Google habe das abgelehnt.

00:05:30: Also baute OpenAI ab im Jahr zwanzig einen eigenen Index mit dem erklärten Ziel bis Jahresende – achtzig Prozent aller Suchernfragen daraus zu beantworten.

00:05:41: Und in derselben Aussage nannte Turley eine weitere Zahl selbst mit vollem Zugriff auf den Google-Index würde es mindestens fünf Jahre dauern überhaupt herauszufinden ob hundertprozent erreichbar sind.

00:05:52: Woran kann man jetzt erkennen, ob Ergebnisse von Chatcha B.T aus dem eigenen Index also aus Labrador stammen?

00:05:58: Da gibt es zunächst mal den Titel Bing Cup-Titel bei ungefähr seventy-fünf Zeichen und dazu wurden Antworten mit achtundachtzigtausend Suchergebnissen ausgewertet und gemessen von Resonero und es zeigte sich dass vierundzwanzig Prozent der Titel aus Labrador über dieser Grenze liegen.

00:06:20: Der längste erfasste Titel, der war stolze twohundertneunundachtzig Zeichen lang und die über scraping bezogenen Google-Ergebnisse verhalten sich anders.

00:06:28: Da enden die Titeln nach rund sechzig Zeichnen dann mit solchen Trunkierungspunkten und Snippets also Descriptions liegen bei etwa hundertsechzig zeichen.

00:06:38: Wenn man in einer Chatchapity Antwort einen ungekürzten auffällig langen Seitentitel sieht, dann stand das Ergebnis mit hoher Wahrscheinlichkeit aus Open Air Ice eigenem Index.

00:06:49: Ja, auch ein weiteres Signal in dem man die Labradorergebnisse erkennen kann.

00:06:54: Das sind Snippets, die sich nicht ändern.

00:06:56: Labrator liefert pro Treffer nämlich drei Dinge – Die URL den vollen Titel und einen Textausschnitt von rund zwei Hundert Zeichen Und dieser Ausschnitt wird beim Indexieren geschnitten und danach unverändert ausgeliefert.

00:07:06: Fragt man zur selben URL zum Beispiel noch nach dem Preis oder der Geschichte eines Produkts Dann bekommt man denselben Text ausgespielt.

00:07:13: Google und Bing passen ihre Snipples seit längerer Zeit jeweils an die Suchanfragen.

00:07:19: Man kann auch mit Bing-Abgleichen um Unterschiede zu erkennen bzw.

00:07:24: dann auch um Labradorantworten zu erkennen und dazu nimmt man einfach verschiedene Prompts aus einem bestimmten Themenumfeld, sammelt die von JetGBT angezeigten Quellen und überprüft wie viele davon in Bing in den Top-Zwanzig zu den entsprechenden Begriffen auftauchen.

00:07:39: und in der Erfassung von Resoneo waren es gerade einmal eins Komma fünf Prozent und kein einziges Labradorsnippet stimmte überein.

00:07:49: Da gibt es noch weitere Dinge, die ich euch dokumentiert habe im Beitrag auf COSetWest.

00:07:53: Schaut euch also gerne an!

00:07:56: Ich möchte aber gerne jetzt weitergehen zu den Maßnahmen, die sich daraus ableiten lassen und da ist ein Punkt ganz wichtig nämlich Sichtbarkeit.

00:08:04: in Google und Bing reicht nicht mehr als Messgröße aus.

00:08:07: das heißt also wer die Sichtbarkeiten in Chatchapity verbessern möchte muss sich um die Indexierung im Laboradorindex kümmern.

00:08:15: außerdem empfiehlt es sich auch die Möglichkeiten auszunutzen, die sich für längere Titel ergeben.

00:08:23: Wenn man sich auf nur fünffünfzig oder sechzig Zeichen beschränkt damit dann der Titel auch komplett in den Suchergebnissen von Google und Bing angezeigt werden kann.

00:08:31: dann verschenkt man Potenzial.

00:08:32: das gilt übrigens auch schon längere Zeit denn Der Titel ist ja auch ein Ranking Faktor.

00:08:36: und nur weil Google nicht mehr als Sechzigzeichen darstellt dann sollte man nicht auf wichtige Keywords im Titel verzichten.

00:08:43: Außerdem sollte man technische Grenzen überprüfen, denn Seiten die über vier Megabyte groß sind oder die JavaScript erfordern um wichtige Inhalte zu liefern.

00:08:54: Die können von ChatGPT nicht gearbeitet werden.

00:08:56: Und gerade bei aufgeblähten Templates, zum Beispiel für WordPress, da ist die vier Megabyte-Marke schneller erreicht als man erwartet und dann fällt diese Seite eben komplett raus.

00:09:06: Ja?

00:09:07: Auch bestimmte Dinge wie Shopping & Local laufen komplett an der Websuche vorbei.

00:09:12: Produktergebnisse in ChatGAPT kommen z.B.

00:09:14: aus Merchant Feeds, lokale Ergebnisse aus Yelp und TripAdvisor.

00:09:18: wären die angezeigten Links für lokale Treffer dann auf Google Maps zeigen und wer Produkte verkauft oder auch ein lokales Ladengeschäft hat, der sollte sich diese Kanäle entsprechend dann auch vornehmen.

00:09:32: Ja man sollte auch die Verticals mitdenken also PDF YouTube News

00:09:37: usw.,

00:09:38: Die haben eigene Indices und ein technisches White Paper als pdf ein Video mit einem sauberen Transkript oder einen gepflegter Wikipedia Eintrag.

00:09:48: Die laufen einfach dann auf anderem Weg in die Ergebnisse von JetGBT, also jetzt die Website.

00:09:55: Und für Fachthemen ist das dann oft mal sogar der leichtere Weg Sichtbarkeit zu erzielen.

00:10:01: Ja und bleiben wir noch kurz bei JetGBt und zwar Stichwort Freshness Windows.

00:10:08: Die Art und Weise wie JetGBTsuchernfragen generiert hat sich ja auch verändert in letzter Zeit und eine Analyse von David Konitzny diese sogenannten Freshness-Windows wirken und worauf SEOs achten sollten.

00:10:25: Also anstelle eines einfachen Suchstrings erzeugt ChatGPT ja in den neueren Query Fan Out Varianten strukturierte Aufrufe mit Zusatzparametern, da gibt es einen Call Tip wie zum Beispiel Fast oder Slow dann die eigentliche Suchanfrage und eben auch noch diesen Freshness Parameter der das gewünschte Zeitfenster für die Aktualität der Ergebnisse in Tagen.

00:10:50: Und anders als klassische Suchoperatoren wie Sight, die das Suchergebnis auf eine bestimmte Domain einschrecken wird der Freshness-Parameter als zusätzlicher Wert an das Retrieval-System übergeben.

00:11:01: Die Suchernfrage selbst bleibt dabei unverändert aber das System erhält eine Anweisung wie die Ergebnisse bezüglich ihrer Aktualität gewichtet werden sollen.

00:11:10: Bei der Unterscheidung zwischen Fast und Slow Calls gibt es auch interessante Beobachtungen.

00:11:17: Fast Calls machen neunzig Prozent aller Queries aus und stehen in rund drei Neunzig-Prozent der Fälle alleine, bei etwa siebenundreißig Prozent der Fastanfragen wird ein Freshness-Parameter mitgegeben.

00:11:29: die Slow Calls treten deutlich seltener auf im ungefähr vierzehn Prozent der Felle aber Sie erhalten in rund ninety fünf Prozent der Falle einen Freshness Parameter Und wenn ChurchBT beide Abrufttypen kombiniert für einen Thema nutzt, dann verfolgen sie meist unterschiedliche Zeithorizonte.

00:11:47: Der FastCall der nutzt ein breites Fenster zum Beispiel dreizig Tage um das Gesamtbild in den allgemeinen Kontext zu erfassen und der Slowcall verengt das Zeitfenster dann stark oft auf einen bis sieben Tage um gezielt die aktuellsten Entwicklungen und Details zu finden.

00:12:04: Und dabei wendet ChatGPT eine zweistufige Strategie an.

00:12:07: Und zwar gibt mir erst den breiten Kontext und zeigt mir erst dann, was genau jetzt wichtig ist.

00:12:13: Dann gibts auch ein dreißig Tage Standardfenster.

00:12:15: Das wurde auch ermittelt bei der Untersuchung von ungefähr zweihundertfünfzigtausend Chats.

00:12:20: Das Dreißig-Tage-Standardfenster wird da eben am häufigsten eingesetzt.

00:12:23: Es gibt aber auch noch einen zehnjahres Fenster.

00:12:27: Und das wird dann im Fall von sozialen Medien zum Beispiel gerne eingesetzt.

00:12:36: Ja, und das sind halt Dinge die sollte man auf jeden Fall wissen und auch einbeziehen damit man die richtigen Inhalte dann für die gewünschten Prom zu Suchenfragen erzeugen kann.

00:12:49: Manche Suchern fragen werden von ChatGPT eben ganz klar eingegrenzt auf Freshness Windows und auch auf bestimmte Domains und wer da nicht das passende liefern kann beziehungsweise wer ja Erwähnt wird, der hat dann eben auch keine Chance auf Mentions oder Citations in Chat GPT.

00:13:12: Ja Google wehrt sich gegen das Scraping seiner Suchergebnisse.

00:13:17: Da haben wir ja schon darüber gesprochen zuletzt mit den Go-to Links also dass die Suchergelbnisse nicht mehr direkt auf die Zielwebsite verlinken.

00:13:25: und jetzt ein weiterer Schritt der offensichtlich gerade getestet wird.

00:13:28: Das ist ein Continue Button Und der erscheint nach dem Absetzen einer Suchanfrage.

00:13:35: Das heißt, wenn man eine Sucha-Frage absetzt dann erscheinert dieser Button.

00:13:39: Der wird dann erst für ein paar Sekunden ausgegraut und erst dann kann man ihn klicken.

00:13:43: und erst danach, wenn er diesen Button geklickt hat, dann werden die Suchergebnisse geladen.

00:13:48: das hat Glenn Gabe gefunden und hat es auch gepostet auf X findet auch den Post in dem Beitrag hier aus CSW.

00:13:56: Und ja, das scheint eben auch eine weitere Möglichkeit zu sein wie Google den Zugriff von KI-Plattformen oder Scrapern erschweren möchte.

00:14:07: Ja dann, Google muss so ein bisschen die Hosen runterlassen.

00:14:10: In der EU im September, zwanzig wurde Alphabet – das ist ja der Mutterkonzern von Google – von der EU Kommission als Gatekeeper unter dem Digital Markets Act für die Google Suche benannt und aus dieser Einstufung ergibt sich für Google gemäß dieses Digital Marketing Act die Verpflichtungen anonymisierte Online-Suchdaten für Drittanbieter von Suchatmaschinen unter fairen, vernünftigen oder nicht diskriminierenden Bedingungen.

00:14:38: zur Verfügung zu stellen.

00:14:40: Um eine wirksame und einheitliche Umsetzung dieser Verpflichtung zu gewährleisten, hat die EU-Kommission am sechzehnten Juli dieses Jahres dann verbindliche Durchführungsmaßnahmen verabschiedet, die dann die genauen Rahmenbedingungen für das sogenannte Google European Search Data Set Licensing Program festlegen.

00:14:59: Und Google hat dementsprechend seine Informationen zu diesem Programm aktualisiert.

00:15:04: Das ist sehr interessant wenn man sich das mal anschaut.

00:15:07: Google ist also verpflichtet, berechtigten dritten Zugriff auf seinen Search dataset zu gewährleisten.

00:15:13: Und dieser Datenumfang erstreckt sich auch vier zentrale Datenkategorien einmal Suchanfrage-Daten die von Endnutzern eingegebenen ursprünglichen Suchbegriffe deren Modifikationen zum Beispiel durch Autovervollständigung oder Korrekturverschläge sowie auch Metadaten wie Nutzerstandort Sprache und Gerätetyp Anzeigedaten angezeigten URLs auf den Suchergebnissen, das ist unabhängig von Format wie Text-Bild oder Video und Reiter wie Webbilder oder News sowie Beschreibungen visueller Elemente.

00:15:44: Klickdaten ist auch sehr spannend.

00:15:45: Daten über Nutzerinteraktionen Auf den Ergebnisseiten einschließlich Klicke reinfolge Verweildauer Hover Aktionen und Scroll Verhalten also die Daten hätte ich auch gerne ehrlich gesagt Und Rankingdaten Information zu absoluten und relativem Positionierung der Sucher Ergebnisse.

00:16:02: Google trägt dann als Verantwortlicher die Pflicht, die personenbezogene Daten der Nutzer vor der Bereitstellung durch strikte technische Maßnahmen zu schützen.

00:16:11: Damit sie anonymisiert werden und zu diesen Maßnahmen gehört zum Beispiel das Entferndirektor Identifikatoren und genauer Zeitstempel des Filtern von Begriff über eine monatlich aktualisierte Positivliste dann Längenschwellenwerte für Abfragen, die Generalisierung von Standortdaten sowie auch die Zusammenfassung verwandter Suchabfolgen in sogenannte Mini-Sessions.

00:16:34: Die EU-Kommission verlangt von Google ein transparentes und strukturiertes Bewerbungsverfahren für diejenigen, die diese Daten haben wollen.

00:16:41: Google muss eine öffentlich zugängliche Website betreiben, die das Programm erläutert und Kontaktmöglichkeiten bietet auf Interessenbekundungen von Suchmaschinenbetreibern, wo es Google innerhalb von sieben Kalendertagen antworten und entsprechende Bewerbungunterlagen sowie Litensvertragsvorlagen übermitteln.

00:16:58: und zudem ist Google verpflichtet die Kommission und die zuständigen Datenschutzbehörden über Bewilligungen, Ablehnungen, Aussetzungen oder Beendigungen von Datenzugängen zu informieren.

00:17:08: Und auf seiner Website eine öffentliche Liste aller lizenzierten Betreiber zu führen!

00:17:13: Der Zugang zu diesem Dataset ist an strenge Berechtigungskriterien geknüpft.

00:17:16: Antragsberechtigt sind Betreber von Online-Suchmaschinen im europäischen Wirtschaftsraum, die seit mindestens zwei Jahren aktiv sind oder bei jüngeren Organisationen über fünfzig Millionen Euro Kapitalinvestitionen vorweisen können und im vergangenen Jahr durchschnittlich mindestens Fünfzigtausend monatliche Nutzer in der EU verzeichnet haben.

00:17:38: Zudem dürfen die Bewerber nicht unter der Kontrolle risikoporhafteter Drittstaaten stehen oder EU-Sanktionen unterliegen, und die zugelassenen Lizenznehmer, die unterlegen ihrerseits strengen Sicherheits- und Auditpflichten.

00:17:49: sie müssen die Daten in einer isolierten Umgebung verarbeiten jegliche Re-Identifizierung von Nutzern unterlassen und die Daten nach spätestens dreizehn Monaten löschen.

00:17:58: Die Einhaltung dieser Vorgaben muss vor der Erstgewährung des Zugangs durch ein unabhängiges Audit anschließend jährlich durch regelmäßige Überprüfungen nachgewiesen werden, also ganz so einfach wird es leider nicht sein an diese Daten zu kommen aber wird vielleicht doch das eine oder andere Unternehmen geben dass ich dafür qualifizieren kann?

00:18:17: ja und dann noch was zum Google AI Mode.

00:18:20: Der lädt nämlich jetzt automatisch für manche Suchanfragen.

00:18:24: Also, manche befürchten ja schon länger.

00:18:26: Google könnte irgendwann seine Suche komplett in Richtung KI-Suche umstellen und zumindest einen weiteren Schritt.

00:18:33: ist Google jetzt diese Richtung gegangen?

00:18:34: für bestimmte Suchanfragen entfällt der Mehr anzeigen Button in den AI Overviews und es wird direkt die Fragebox geladen, die zum AI Mode gehört.

00:18:45: Und ja, Robbie Steen von Google hat das bestätigt.

00:18:48: Er hat auf X geschrieben, dass passiere für bestimmte Suchanfragen bei denen die Google-Systeme das für hilfreiche achten.

00:18:55: und wenn ein Nutzer allerdings bereits heruntergescrollt habe dann werde diese Erweiterung gestoppt um die Position zu halten.

00:19:03: Ob und wann Google das ausweiten wird?

00:19:04: Das ist noch unklares zeigt aber, dass sich die Suche weiter im Wandel in Richtung KI befindet.

00:19:10: Ja!

00:19:10: Das wäre es gewesen in dieser Ausgabe von Seehoem Ohr.

00:19:13: Ich freue mich, Bis zum Ende dabei geblieben seid und hoffe natürlich sehr, dass etwas Interessantes für euch dabei war.

00:19:19: Schickt mir gerne eure Meinung wenn ihr Fragen, wenn ihr Feedback, wenn Ihr Kritik habt!

00:19:24: Und ansonsten würde ich mich freuen, wenn du das sechste Mal auch wieder dabei seit bei der nächsten Ausgabe von SEO im Ohr dann in etwa einer Woche.

00:19:31: ja und schaut auch regelmäßig auf SEO Sylvester bei.

00:19:32: da gibt es für euch täglich die aktuellsten SEO News.

00:19:35: bis dahin tschüss euer Christian.

New comment

Your name or nickname, will be shown publicly
At least 10 characters long
By submitting your comment you agree that the content of the field "Name or nickname" will be stored and shown publicly next to your comment. Using your real name is optional.