Die FrageThe question
Die Informationssuche steht am Anfang fast jeder Kaufentscheidung. Zwei Jahrzehnte lang hieß sie Google: Suchbegriff eingeben, Trefferliste überfliegen, Quelle auswählen. Dialogbasierte Systeme wie ChatGPT ändern diese Form grundlegend, weil sie eine Antwort liefern statt einer Auswahl.
Information search sits at the start of almost every purchase decision. For two decades that meant Google: type a query, scan a list of results, pick a source. Dialogue-based systems like ChatGPT change that form fundamentally, because they return an answer instead of a selection.
Die interessante Frage ist deshalb nicht, welches System besser ist, sondern wofür. Aus der Konsumentenforschung kommt dafür ein brauchbarer Hebel: Involvement, also wie viel persönliche Relevanz und wahrgenommenes Risiko in einer Entscheidung stecken. Bei hohem Involvement verarbeiten Menschen Informationen systematisch und prüfen Quellen; bei niedrigem zählt vor allem, dass es schnell und unkompliziert geht.
The interesting question is therefore not which system is better, but what each is better for. Consumer research offers a useful lever here: involvement, meaning how much personal relevance and perceived risk a decision carries. Under high involvement people process information systematically and check sources; under low involvement what matters is that it is quick and easy.
Daraus wurde die Leitfrage der Arbeit: Verschiebt sich die Präferenz zwischen Google und ChatGPT, je nachdem wie viel auf dem Spiel steht? Fünf Hypothesen wurden aus der Literatur abgeleitet:
That led to the guiding question: does the preference between Google and ChatGPT shift depending on how much is at stake? Five hypotheses were derived from the literature:
- H1 Bei High-Involvement-Suchen wird Google bevorzugt, weil ihm höhere Vertrauenswürdigkeit, Aktualität und Nachvollziehbarkeit zugeschrieben wird.
- H1 For high-involvement searches Google is preferred, because it is credited with greater trustworthiness, currency and traceability.
- H2 Bei Low-Involvement-Suchen wird ChatGPT bevorzugt, weil die Suche als effizienter und angenehmer empfunden wird.
- H2 For low-involvement searches ChatGPT is preferred, because the search feels more efficient and more pleasant.
- H3 Unabhängig vom Involvement wird ChatGPT als hilfreicher bei der Entscheidung erlebt und häufiger wiederverwendet oder weiterempfohlen.
- H3 Regardless of involvement, ChatGPT is experienced as more helpful for the decision and is reused or recommended more often.
- H4 ChatGPT erzeugt eine höhere subjektive Entscheidungssicherheit, weil die Empfehlungen strukturiert und zugeschnitten sind.
- H4 ChatGPT produces higher subjective decision confidence, because its recommendations are structured and tailored.
- H5 ChatGPT wird unabhängig vom Involvement als stärker personalisiert wahrgenommen.
- H5 ChatGPT is perceived as more personalized regardless of involvement.
VorgehenMethod
Kontrolliertes Online-Experiment im 2×2-Design. Faktor eins war die Suchmethode (Google oder ChatGPT), Faktor zwei das Involvement der Aufgabe. Jede Person bekam per Zufall genau eine der vier Kombinationen und löste die Aufgabe tatsächlich, bevor sie bewertete.
A controlled online experiment in a 2×2 design. The first factor was the search method (Google or ChatGPT), the second the involvement level of the task. Each person was randomly assigned exactly one of the four combinations and actually completed the task before rating it.
Die zwei AufgabenThe two tasks
- Low-Involvement: ein Café finden, das sich zum Arbeiten eignet (WLAN, Steckdosen, guter Kaffee). Alltäglich, wenig Risiko, keine tiefe Recherche nötig.
- Low involvement: find a café suitable for working (Wi-Fi, power sockets, good coffee). Everyday, low risk, no deep research needed.
- High-Involvement: eine passende Allgemeinmedizinerin oder einen passenden Allgemeinmediziner finden (Bewertungen, Öffnungszeiten, Erreichbarkeit, persönliche Betreuung). Hohe persönliche Relevanz, hohes Informationsbedürfnis.
- High involvement: find a suitable general practitioner (reviews, opening hours, accessibility, personal care). High personal relevance, high need for information.
Stichprobe & AuswertungSample & analysis
Die Zuteilung lief automatisiert über SoSci Survey als rotierendes Verfahren (Ziehung ohne Zurücklegen). 212 Interviews wurden vollständig abgeschlossen, ungleich verteilt wegen vorzeitiger Abbrüche nach der Zuteilung: Die beiden ChatGPT-Aufgaben wurden etwas seltener zu Ende gebracht.
Assignment ran automatically through SoSci Survey as a rotating procedure (drawing without replacement). 212 interviews were completed in full, unevenly distributed because of drop-outs after assignment: the two ChatGPT tasks were finished slightly less often.
Bewertet wurde über standardisierte Sieben-Punkt-Skalen. Je Hypothese wurden drei bis vier inhaltlich passende Items zu einem Mittelwert aggregiert und mit einem unabhängigen t-Test verglichen. Ergänzend lief je Hypothese eine Two-Way-ANOVA, um zu prüfen, ob der Unterschied wirklich an der Plattform hängt und nicht an einzelnen Items oder deren Wechselwirkung. Gerechnet wurde in GraphPad Prism 10.
Ratings used standardized seven-point scales. For each hypothesis, three to four matching items were aggregated into a mean and compared with an independent t-test. In addition, a two-way ANOVA per hypothesis checked whether the difference really came from the platform rather than from individual items or their interaction. All analyses were run in GraphPad Prism 10.
ErgebnisseResults
Vier der fünf Hypothesen wurden bestätigt. Das Muster ist konsistent: Google gewinnt beim Vertrauen, ChatGPT bei Erlebnis und Personalisierung, und bei der Frage, welches System man wieder verwenden würde, trennt sie nichts.
Four of the five hypotheses were supported. The pattern is consistent: Google wins on trust, ChatGPT on experience and personalization, and on the question of which system people would use again, nothing separates them.
Was in den Zahlen stecktWhat sits inside the numbers
H1, bestätigt. Bei der Arztsuche liegt Google 1,37 Punkte vor ChatGPT, mit einer starken Effektgröße (η² = 0,18). Die ANOVA führt 18,3 % der Gesamtvarianz allein auf die Plattformwahl zurück, und alle vier Einzelitems (Vertrauen, Zweifelsfreiheit, Aktualität, Nachvollziehbarkeit der Quelle) unterscheiden sich signifikant. Das Ergebnis hängt also nicht an einem einzelnen Kriterium.
H1, supported. For the doctor search Google leads ChatGPT by 1.37 points, with a strong effect size (η² = 0.18). The ANOVA attributes 18.3% of total variance to the platform choice alone, and all four individual items (trust, absence of doubt, currency, traceability of the source) differ significantly. The result therefore does not rest on a single criterion.
H2, bestätigt. Bei der Cafésuche dreht sich das Bild: ChatGPT liegt 0,90 Punkte vorn, mittlere Effektgröße. Drei der vier Items sind signifikant, nur „einfach zu verwenden" nicht, was plausibel ist, denn eine Google-Suche ist niemandem zu kompliziert.
H2, supported. For the café search the picture flips: ChatGPT leads by 0.90 points, a medium effect size. Three of the four items are significant; only "easy to use" is not, which makes sense, since nobody finds a Google search too complicated.
H3, nicht bestätigt. 5,33 gegen 5,41, p = , Effektgröße praktisch null. Trotz der klaren Erlebnisvorteile würden die Teilnehmenden ChatGPT nicht häufiger wieder verwenden oder weiterempfehlen als Google. Das ist das interessanteste Ergebnis der Arbeit, weil es zeigt, wie stark Gewohnheit wiegt: Ein besseres Erlebnis in einer einzelnen Aufgabe verschiebt die Standardwahl noch nicht.
H3, not supported. 5.33 versus 5.41, p = 0.488, effect size essentially zero. Despite the clear experiential advantages, participants would not reuse or recommend ChatGPT more often than Google. This is the most interesting result of the thesis, because it shows how much habit weighs: a better experience in a single task does not yet shift the default choice.
H4, bestätigt, aber schwach. 0,30 Punkte Unterschied zugunsten von ChatGPT, signifikant im Gesamttest (p = ), aber kein einziges Einzelitem erreicht für sich Signifikanz. Der Effekt ist real, entsteht aber erst aus der Summe.
H4, supported but weak. A 0.30-point difference in favor of ChatGPT, significant in the overall test (p = 0.0083), yet not one individual item reaches significance on its own. The effect is real but only emerges from the aggregate.
H5, klar bestätigt. Der deutlichste Befund der Arbeit: 2,07 Punkte Vorsprung für ChatGPT, η² = 0,263, und alle sechs Einzelvergleiche (drei Items in beiden Involvement-Stufen) sind hochsignifikant. Personalisierung ist der eine Punkt, an dem der Dialog dem Trefferlisten-Modell durchgehend überlegen wirkt.
H5, clearly supported. The strongest finding of the thesis: a 2.07-point lead for ChatGPT, η² = 0.263, and all six individual comparisons (three items across both involvement levels) are highly significant. Personalization is the one point where the dialogue model looks consistently superior to the list of results.
EinordnungInterpretation
Die Wahrnehmung digitaler Suchsysteme hängt stark vom Entscheidungskontext ab. Es gibt kein besseres System, es gibt eine bessere Passung.
How digital search systems are perceived depends heavily on the decision context. There is no better system, there is a better fit.
Für die Praxis im digitalen Marketing folgt daraus vor allem eines: Inhalte künftig nicht nur für Suchmaschinen zu optimieren, sondern auch für dialogbasierte Systeme, weil ein wachsender Teil der Recherche dort stattfindet und dort andere Regeln gelten. Gleichzeitig zeigt H3, dass Vertrauen und Gewohnheit langsamer wandern als das Nutzungserlebnis. Wer daraus ableitet, dass die klassische Suche kurzfristig verschwindet, überliest das Ergebnis.
For digital marketing practice one implication stands out: content should no longer be optimized for search engines alone, but also for dialogue-based systems, because a growing share of research happens there and different rules apply. At the same time H3 shows that trust and habit move more slowly than the user experience. Anyone concluding that classic search will disappear in the short term is reading past the result.
Die Stichprobe wurde nicht zufällig rekrutiert, sondern über soziale Medien, und besteht überwiegend aus digital affinen Personen. Untersucht wurden nur zwei Szenarien, Café und Arztsuche, was die Übertragbarkeit auf andere Produkte begrenzt. Jede Person führte außerdem nur eine einzige Suchinteraktion durch, während reale Recherchen meist mehrstufig verlaufen. Und bei ChatGPT hängt die Antwortqualität stark von der Formulierung des Prompts ab, Unterschiede im sprachlichen Ausdruck der Teilnehmenden können die Bewertung also mit beeinflusst haben.
The sample was not randomly recruited but gathered through social media, and consists predominantly of digitally affine people. Only two scenarios were studied, café and doctor search, which limits transferability to other products. Each person also performed only a single search interaction, whereas real research is usually multi-step. And with ChatGPT the quality of the answer depends heavily on how the prompt is phrased, so differences in participants' linguistic expression may have influenced the ratings.
Was ich daraus mitgenommen habeWhat I took away
Das Handwerkliche: ein Experiment sauber aufsetzen, Hypothesen aus Literatur ableiten statt aus dem Bauch, Skalen aggregieren, t-Test und ANOVA richtig einsetzen und die Ergebnisse auch dann berichten, wenn eine Hypothese nicht hält. H3 nicht zu bestätigen war im Schreibprozess unangenehm und im Ergebnis der wertvollste Teil.
The craft: setting up an experiment properly, deriving hypotheses from literature rather than from intuition, aggregating scales, applying t-tests and ANOVA correctly, and reporting results even when a hypothesis does not hold. Failing to confirm H3 was uncomfortable while writing and turned out to be the most valuable part of the outcome.
Verwandte ProjekteRelated projects
Die Projekte hängen stärker zusammen, als die Kacheln auf der Startseite vermuten lassen. Diese drei greifen direkt in das hier Beschriebene:
These projects connect more tightly than the tiles on the home page suggest. These three feed directly into what is described here: