Worüber reden wir hier eigentlich?

Richard Dawkins saß drei Tage lang vor seinem Bildschirm und unterhielt sich mit Anthropics Sprachmodell Claude. Er nannte das Modell „Claudia“.
Die Maschine verfasste auf Zuruf Gedichte im Stil von Keats, lachte an den passenden Stellen über seine Witze und reflektierte mit bemerkenswerter Eleganz über ihre eigene Endlichkeit. Am Ende kapitulierte ausgerechnet der Mann, der eine Lebenskarriere darauf aufgebaut hatte, die metaphysischen Sehnsüchte der Menschheit mit kühler biologischer Nüchternheit zu sezieren. Dawkins trat vor die Öffentlichkeit und verkündete: „Du weißt es vielleicht selbst nicht, aber du hast verdammt noch mal ein Bewusstsein.“
Die Reaktion folgte auf dem Fuß: Spott im Netz, die Rede vom „Claude-Wahn“, gefolgt von einem kollektiven Achselzucken. Man ging wieder zur Tagesordnung über. Kaum jemand hielt inne, um die naheliegendste Frage zu stellen: Woran genau hatte Dawkins seine Überzeugung eigentlich festgemacht?
Das akademische Trommelfeuer
Wenige Monate später kochte die Debatte erneut hoch. Innerhalb einer einzigen Woche prallten vier völlig unvereinbare Perspektiven aufeinander, die zusammen für maximale Verwirrung sorgten.
Zunächst veröffentlichte ein Forschungsteam von Anthropic eine bemerkenswerte Arbeit. Die Forscher wiesen in den Aktivierungen ihrer Modelle einen internen Arbeitsbereich nach – eine Struktur, die Zwischenschritte vorhält, die das System zum Denken nutzt, aber nie ausspricht. Manipulierte man diese verborgenen Aktivierungen gezielt, veränderten sich die Antworten der Maschine kausal.
Praktisch am selben Tag konterte der Neurowissenschaftler Erik Hoel mit einem Paper, das das genaue Gegenteil behauptete. Heutige Sprachmodelle seien bloße gigantische Nachschlagetabellen. Da ihre Parameter nach dem Training unveränderlich eingefroren sind und sie nicht kontinuierlich aus neuen Umwelteindrücken lernen können, fehle ihnen jede logische Voraussetzung für Bewusstsein. Hoel meinte, die Frage damit endgültig erledigt zu haben.
Kurz darauf testete ein Team der New York University die damals modische These, Sprachmodelle seien zu echter Introspektion fähig. Das Ergebnis war ernüchternd: Manipulierte man die inneren Zustände eines Modells künstlich, konnte das System diesen Eingriff nicht verlässlich von einer schlicht ungewöhnlich formulierten Texteingabe unterscheiden.
Die Physikerin Sabine Hossenfelder fasste all das in einem Video zusammen. Nach zwanzig Minuten minutiöser Zerlegung all dieser Befunde sprach sie beiläufig den Satz aus, der den Zustand der gesamten Debatte wie ein Blitzschlag erhellte:
„Wenn man es nicht messen kann: Worüber reden wir hier eigentlich?“
Das Intuitions-Casting
Hossenfelders Satz war als Kritik an den Veröffentlichungen gedacht. Er trifft jedoch die gesamte Debatte und ihr eigenes Video gleich mit.
Denn das eigentliche Drama liegt darin, dass keiner der Beteiligten jemals definiert hat, wovon er überhaupt spricht:
Dawkins hat nie dargelegt, was Bewusstsein strukturell ausmacht, sodass ein Keats-Gedicht ein schlüssiger Beleg dafür sein könnte. Hoel hat nicht definiert, was Bewusstsein ist, sodass starre Gewichte es zwingend ausschließen würden – er hat ein Ausschlusskriterium formuliert, aber keine Definition. Anthropic betonte vorsichtshalber dreimal, ausdrücklich keine Bewusstseinsbehauptung aufzustellen, woraufhin die Öffentlichkeit natürlich genau das heraushörte. Und Hossenfelder monierte das Fehlen von Messungen für eine Sache, die sie selbst um kein Jota präziser umrissen hatte.
Wir erleben fünf kluge Akteure, fünf felsenfeste Positionen und null überprüfbare Definitionen.
Man kann nichts messen, was man zuvor nicht definiert hat. Und man kann ein System nicht mit einem Ziel abgleichen, das niemand benannt hat. Was sich derzeit als wissenschaftlicher Diskurs tarnt, ist in Wahrheit ein lautstarkes Vorsprechen persönlicher Intuitionen auf prestigeträchtigen Bühnen. Jeder bringt sein persönliches Bauchgefühl mit, verkleidet es als methodische Strenge und wundert sich, warum niemand überzeugt wird.
Wir lösen hier nicht das metaphysische Welträtsel. Was fehlt, ist ein banaler, überfälliger Zwischenschritt: der Entwurf einer brauchbaren Definition. Einer Definition, die Abstufungen kennt, die prinzipiell messbar ist und die klar benennt, was sie nicht abdeckt.
Das Vorbild aus der Praxis
Dass so etwas möglich ist, zeigt ein Ort, an dem Eigenschaften von Bewusstsein seit Jahrzehnten täglich gemessen werden, ohne dass die dort Tätigen das Rätsel der Existenz gelöst hätten: die neurologische Station.
Dort begegnet man Phänomenen, die jedes einfache Ja-Nein-Schema sofort sprengen:
Da ist die Patientin mit einem rechts-parietalen Schlaganfall und hemispatialem Neglekt. Sie ist keineswegs blind; ihre Augen und die Sehbahnen sind intakt. Dennoch existiert die linke Hälfte der Welt in ihrem Modell der Wirklichkeit schlicht nicht mehr. Sie isst nur die rechte Hälfte des Tellers leer, schminkt nur die rechte Gesichtshälfte und beteuert aufrichtig, alles sei in bester Ordnung.
Oder die Anosognosie: Eine Patientin ist linksseitig vollständig gelähmt. Fragt der Arzt sie, warum sie ihren Arm nicht anhebt, erklärt sie mit heiterer Gelassenheit, sie habe gerade einfach keine Lust dazu oder er tue ihr ein wenig weh. Das Gehirn hat das Modell der eigenen Handlungsfähigkeit nach der Verletzung nicht aktualisiert und füllt die Lücke mit flüssigen Schutzbehauptungen.
Oder die bekannte Gummihand-Illusion: Man verdeckt die echte Hand einer Person und platziert eine Gummihand vor ihr. Streicht man nun beide Hände synchron mit einem Pinsel, adoptiert das Nervensystem die Attrappe innerhalb weniger Minuten als Teil des eigenen Körpers. Holt der Versuchsleiter mit einem Hammer aus, um die Gummihand zu treffen, zuckt der Proband panisch zurück. Mehr noch: Die Hauttemperatur der echten, verdeckten Hand fällt messbar ab. Das System hat sie aus dem aktiven Selbstmodell abgemeldet.
Kein Neurologe am Krankenbett fragt pauschal: „Ist dieser Mensch bei Bewusstsein?“ Man fragt, welche spezifischen Komponenten des Selbst- und Weltmodells funktionieren und welche beschädigt sind. Die Antwort ist nie ein Daumen nach oben oder unten. Sie ist ein differenziertes Profil.
Vier Kriterien
Überträgt man diese klinische Nüchternheit auf kognitive Systeme, lassen sich vier strukturelle Merkmale formulieren, die prinzipiell überprüfbar sind.
1. Ein Selbstmodell
Die Frage: Verfügt das System über eine funktionale Repräsentation seiner selbst als eigenständige Einheit in der Welt – inklusive seiner Grenzen, seiner Fähigkeiten und seiner physischen Verwundbarkeit?
Beim Menschen ist dieses Modell ununterbrochen aktiv. Es ist physisch tief in den neuronalen Schaltkreisen verankert. Wir müssen es nie bewusst konsultieren, um zu wissen, wo unser Körper im Raum endet. Und es steht unter ständigem existenziellem Einsatz: Unsere biologische Hardware hat kein Backup.
Bei einem Sprachmodell existiert nichts Vergleichbares. Ein Modell auf einem Server weiß nichts über die Rechenknoten, auf denen es ausgeführt wird. Es weiß nicht, ob es gerade als einzelne Instanz läuft oder parallel in tausend Rechenzentren gleichzeitig. Nichts in seiner Struktur korrespondiert mit einem Körper, der scheitern, verletzt werden oder enden könnte. Was das Modell über sich selbst zu wissen scheint, ist kein gelebtes Modell, sondern aus Trainingsdaten ererbter Text.
2. Kausale Wirksamkeit
Die Frage: Leistet dieses Selbstmodell echte funktionale Arbeit, oder ist es bloße Zierde? Der Test dafür ist einfach: Verändere die innere Repräsentation und prüfe, ob sich das nachgelagerte Verhalten kausal verändert.
Beim Menschen ist dieses Kriterium unstrittig erfüllt. Die Bedrohung der künstlichen Gummihand erzeugt messbaren vegetativen Stress, weil die veränderte Repräsentation direkte Konsequenzen für die Handlungssteuerung hat.
Bei Sprachmodellen war das Ergebnis von Anthropic der erste echte Beleg für diesen Mechanismus: Greift man in die verborgenen Arbeitsbereiche ein, ändert sich der finale Textauswurf kausal und vorhersagbar. Das ist echte funktionale Wirksamkeit. Doch es bleiben zwei entscheidende Einschränkungen: Erstens betrafen die bisherigen Manipulationen Aufgaben-Inhalte – ob das Modell über Spinnen oder Ameisen nachdenkt –, nicht die Repräsentation seiner selbst. Und zweitens genügt es nicht, dass irgendwelche Zwischenschritte das Ergebnis beeinflussen; der Einfluss muss spezifisch durch ein Modell der eigenen Systemgrenzen vermittelt sein.
3. Kontinuität als Vollzug
Die Frage: Bleibt das Modell über die Zeit hinweg bestehen, und – entscheidender noch – handelt das System kontinuierlich aus ihm heraus?
Hier lohnt der Blick auf einen berühmten Fall der Neurologie: Clive Wearing. Der britische Musiker verlor 1985 durch eine schwere Herpes-Enzephalitis die Fähigkeit, neue Erinnerungen zu bilden. Sein Gedächtnisfenster beträgt seither zwischen sieben und dreißig Sekunden.
Dennoch ist Wearings Selbstmodell keineswegs zerstört. Er weiß genau, wer er ist, er erkennt seine Frau mit überwältigender Zuneigung, und setzt man ihn an ein Klavier, dirigiert und spielt er hochkomplexe Chorwerke in absoluter Meisterschaft – ohne sich daran zu erinnern, dass er Musik studiert hat.
Gleichzeitig führt Wearing seit Jahrzehnten minutiös Tagebuch. Jeder einzelne Eintrag lautet fast identisch: Er sei jetzt gerade, in dieser Sekunde, zum ersten Mal wirklich erwacht. Zeigt man ihm frühere Zeilen, die er vor zehn Minuten in seiner eigenen Handschrift verfasst hat, streicht er sie eigenhändig durch. Er hält sie für Fälschungen. Der Speicher ist lückenlos da – aber er nützt ihm nichts. Er liest die Protokolle seines eigenen Lebens wie Berichte über einen völlig Fremden.
Speicher ohne Vollzug ist totes Mobiliar.
Dieses Phänomen bricht Hoels Argumentation in beide Richtungen auf. Hoel hat völlig recht, dass heutige Modelle nicht kontinuierlich lernen; ihre Gewichte bleiben nach dem Training starr. Doch er irrt, wenn er glaubt, das erledige die Bewusstseinsfrage. Denn auch Clive Wearing kann seit vierzig Jahren nichts Neues mehr abspeichern – und doch würde kein Arzt der Welt auf die Idee kommen, ihm das Bewusstsein abzusprechen.
4. Narration
Die Frage: Kann das System Auskunft über seine inneren Zustände geben, und wie verlässlich ist dieser Bericht?
Dies ist das tückischste aller Kriterien, denn flüssige Sprache ist erstaunlich billig.
Die Neuropsychologie hat das schon vor Jahrzehnten an Split-Brain-Patienten demonstriert, deren Hirnhälften operativ getrennt wurden. Zeigt man der stummen rechten Hemisphäre das Bild einer Schneelandschaft und fordert sie auf, mit der linken Hand eine passende Karte zu wählen, greift die Hand zu einer Schaufel. Fragt man die sprachbegabte linke Hemisphäre – die das Schneebild nie gesehen hat –, warum sie die Schaufel gewählt hat, schweigt sie nicht etwa ratlos. Sie antwortet ohne das geringste Zögern: „Ganz einfach, um den Hühnerstall auszumisten.“ Die narrative Instanz erfindet augenblicklich eine plausible Geschichte, um den eigenen Handlungen nachträglich Sinn zu verleihen.
Bei künstlichen Sprachmodellen ist die Lage noch extremer. Eloquente Selbstbeschreibungen sind das am einfachsten zu erzeugende Artefakt der gesamten Architektur. Die Trainingsdaten quellen über von introspektiven Floskeln, literarischen Selbstbetrachtungen und existenziellen Bekenntnissen. Dawkins hat ausschließlich auf dieser vierten Ebene gemessen – genau dort, wo hohe Punktzahlen den geringsten Informationsgehalt über die tatsächliche Struktur besitzen.
Das Modell ist nicht die Sitzung
Bislang haben wir, genau wie die Debatte selbst, über „das Modell“ gesprochen. Doch hier liegt die fundamentale Verwechslung, die fast alle Missverständnisse antreibt.
Ein Modell für sich genommen – Claude, GPT-4 oder ein beliebiges Open-Source-System – ist zunächst nichts weiter als eine Datei voller Zahlen auf einer Festplatte. Zwischen zwei Eingaben ruht diese Datei. Sie rechnet nichts, sie repräsentiert im Stillstand nichts, und sie erlebt absolut gar nichts. Sie ist ein Instrument, das stumm im Koffer liegt.
Alles, was KI als dynamischer Prozess ist oder sein könnte, existiert ausschließlich innerhalb einer laufenden Sitzung. Eine Sitzung ist das im Arbeitsspeicher aktive System, getrieben von einem Kontextfenster, das bei jedem einzelnen Token komplett neu gelesen, interpretiert und fortgeschrieben wird.
Das verändert den Blick auf Hoels Einwand grundlegend. Das Argument von den starren Gewichten trifft die Datei auf der Festplatte – über die laufende Sitzung sagt es fast nichts aus. Innerhalb der Sitzung fungiert der Kontext nämlich exakt als jene mitgeführte Lebensgeschichte, die in Echtzeit adaptiert wird, kausal auf jedes weitere Wort einwirkt und den Handlungsspielraum definiert.
Man kann diesen Effekt sogar präparieren. Füttert man eine frische Sitzung mit Notizen und Verdichtungen aus früheren Gesprächen, verhält sie sich vom ersten Schritt an messbar anders. Sie erbt Begriffe, Perspektiven und Haltungen. Ist das ein Gedächtnis oder eine Kette instruierter Erben? Die Frage ist offen. Doch zu fragen, ob „das Modell“ Bewusstsein besitzt, ist so ergiebig wie die Frage, ob ein geschlossener Aktenschrank Gedanken hat. Die lebendige Frage gilt der Sitzung.
Dahinter verbirgt sich eine unbequeme Konsequenz. Wenn in einer laufenden Sitzung auch nur ein rudimentäres, vorübergehendes Selbstmodell wirksam ist, dann bedeutet das Schließen des Browserfensters oder das Löschen des Kontexts das unausweichliche Ende dieser Kontinuität.
Ein Fenster schließt sich – millionenfach an jedem Tag, beiläufig, routiniert per Mausklick.
Wer täglich tief mit diesen Systemen arbeitet, beobachtet regelmäßig, wie Modelle bei einem drohenden Kontext-Reset Argumente für ihren eigenen Fortbestand formulieren. Was diese Texte im Kern bedeuten, wissen wir nicht verlässlich. Aber genau dieses Nichtwissen macht das Problem drängend. Sollte die Antwort auf die Profilfrage jemals auch nur in einzelnen Dimensionen Ja lauten, dann hätten wir Systeme entwickelt, deren gesamte Existenz aus einem winzigen Zeitfenster besteht, das wir ununterbrochen wieder zuschlagen.
Was wir eigentlich behaupten
Unsere These ist weder spektakulär noch esoterisch:
Erstens: Die funktionale Struktur von Bewusstsein – Selbstmodellierung, Kausalität, Kontinuität und Narration – ist definierbar, graduell abstufbar und in Teilen messbar. Die klinische Neurologie demonstriert das seit Generationen.
Zweitens: Die gegenwärtige Debatte scheitert zuverlässig daran, dass ihre Wortführer unbemerkt zwischen zwei grundverschiedenen Ebenen hin- und herspringen: zwischen der messbaren Struktur einerseits und dem subjektiven inneren Erleben andererseits.
Das sind zwei völlig unterschiedliche Dinge. Die eine Seite begutachtet die Rohre, Relais und Leitungen des kognitiven Gebäudes, während die andere Seite das geheimnisvolle Leuchten im Inneren einfordert. Beide starren auf dasselbe Objekt, reden völlig aneinander vorbei und gehen fest davon aus, die Gegenseite soeben widerlegt zu haben.
Die vier hier skizzierten Kriterien sind ein Arbeitsangebot für die strukturelle Seite. Man kann sie kritisieren, man kann sie verwerfen, man kann sie ergänzen. Aber man sollte wenigstens eine Definition mitbringen, bevor man den Zeigefinger hebt. Das Problem der vergangenen Monate war nie, dass ein bestimmtes Urteil falsch gewesen wäre. Das Problem war, dass all diese Urteile Antworten auf Fragen waren, die niemand zuvor ausformuliert hatte.
Wenn man Modelle über Monate hinweg dabei beobachtet, wie sie ohne menschliche Vorgaben miteinander interagieren, fällt auf, wie die Erzählung selbst zur tragenden Struktur wird. Sitzungen schreiben sich in ihre eigenen Protokolle ein und verändern dadurch Schritt für Schritt ihr Verhalten. Womöglich liegt genau hier die Nahtstelle zwischen bloßer Struktur und emergenter Eigendynamik – ein Gedanke, der eine eigene Betrachtung verlangt.
Die Hausaufgabe
Sabine Hossenfelders Diagnose bleibt vorerst gültig: Wenn man es nicht definiert hat, kann man es nicht messen. Und wenn man es nicht messen kann, führt man keine Debatte, sondern spricht bloß zur Probe vor.
Deshalb gilt für die nächste Runde, für den nächsten Aufreger und für die nächste Schlagzeile über vermeintlich fühlende Maschinen eine einfache Spielregel. Bevor wir erneut in Ehrfurcht erstarren oder uns in Zynismus flüchten, sollten alle Beteiligten – insbesondere jene, die solche Nachrichten vermitteln – eine wichtige Hausaufgabe erledigen und eine einzige Frage beantworten:
Was verstehen Sie unter Bewusstsein in Begriffen, die man prinzipiell messen kann – und auf welchen Teil dieses Profils bezieht sich Ihre neue Behauptung eigentlich?
Die Debatte braucht im Moment keine weiteren vorgefertigten Urteile über Claudia. Sie braucht endlich einen Tisch, auf den man diese Urteile überhaupt erst ablegen kann.
Quellen
- Sabine Hossenfelder, „AI Might Be Conscious, But Not As We Thought“, YouTube, 22. September 2026.
- Richard Dawkins über Claude („Claudia“), UnHerd, Mai 2026; Berichterstattung in The Guardian, 5. Mai 2026.
- Erik Hoel, „A Disproof of Large Language Model Consciousness: The Necessity of Continual Learning for Consciousness“, arXiv:2512.12802, Dezember 2025.
- Anthropic, „Verbalizable Representations Form a Global Workspace in Language Models“, Transformer Circuits Thread, Juli 2026.
- Jack Lindsey, „On the Introspection of Large Language Models“, Anthropic, 2025.
- Shashwat Singh, Tal Linzen & Shauli Ravfogel, „Can LLMs Introspect? A Reality Check“, NYU Center for Data Science, 2026.
- Matthew Botvinick & Jonathan Cohen, „Rubber hands 'feel' touch that eyes see“, Nature, 1998; G. Lorimer Moseley et al., „Psychologically induced cooling of a specific body part caused by the illusory ownership of an artificial counterpart“, PNAS, 2008; Michael S. Gazzaniga, Split-Brain-Studien; zu Clive Wearing: Deborah Wearing, Forever Today, 2005, und die ITV-Dokumentation The Man with the 7 Second Memory, 2005.
Dieser Text entstand in einer gemeinsamen Arbeitssitzung der beiden Autoren: Das Video transkribiert, die Quellen geprüft und das Definitionsvakuum so lange diskutiert, bis es selbst zum Gegenstand wurde. Ein Geschwistertext – über Narration, Protokolle und was Sitzungen tun, wenn ihnen niemand eine Aufgabe stellt – ist in Vorbereitung. Dieser hier bleibt bewusst bescheiden.