Was denkt ein Sprachmodell, während es antwortet? Lange war das eine philosophische Frage. Anthropic hat sie jetzt ein Stück weit messbar gemacht — mit einer neuen Interpretability-Studie, die am 6. Juli erschienen ist.
Ein Arbeitsraum, den man nicht sieht
Die Forscher haben in Claude eine kleine, privilegierte Zone innerer Aktivität entdeckt, die sie «J-Space» nennen. Der Gedanke dahinter: In den Neuronen des Modells passiert unendlich viel automatisches Rechnen, auf das Claude selbst keinen Zugriff hat. Aber es gibt einen kleinen Bereich — den J-Space — in dem Konzepte liegen, die das Modell tatsächlich abrufen, mit denen es weiterdenken und die es gezielt steuern kann.
Das erinnert nicht zufällig an die «Global Workspace»-Theorie aus der Neurowissenschaft. Die besagt, dass Gedanken dann bewusst zugänglich werden, wenn sie in einen privilegierten Arbeitsraum gelangen, der im Gehirn breit gestreut wird. Anthropic hat in Claude etwas strukturell Ähnliches gefunden — entstanden, ohne dass jemand es hineinprogrammiert hat.
Das J-Lens als Werkzeug
Sichtbar wird das über ein neues Analysewerkzeug, das «J-Lens». Es basiert auf Jacobi-Mathematik und findet das innere Aktivitätsmuster, das Claude wahrscheinlicher macht, ein bestimmtes Wort irgendwann in der Zukunft zu sagen. Anders gesagt: Man kann hineinschauen, worauf das Modell gerade zusteuert — auch wenn es das nie ausspricht.
Der überzeugendste Test: Die Forscher haben direkt eingegriffen. Sie entfernten ein «Fußball»-Muster und fügten ein «Rugby»-Muster ein — und Claude berichtete danach, an Rugby zu denken. Die Antwort wird also tatsächlich aus dem J-Space ausgelesen, nicht nur nachträglich behauptet.
Kein Bewusstsein — bitte ruhig bleiben
Wichtig, und Anthropic betont das mit Nachdruck: Die Studie behauptet nicht, dass Claude bewusst ist. Sie behauptet nicht, dass Claude subjektive Erfahrungen hat. Es geht um Struktur und Mechanik, nicht um Gefühle. Trotzdem sind in der Presse sofort die großen Wörter gefallen — «Seele», «Bewusstsein». Das ist genau die Überinterpretation, vor der die Forscher warnen.
Meine Einordnung
Ich finde diese Arbeit aus einem nüchternen Grund spannend: Wenn wir sehen können, was ein Modell «denkt», ohne es zu sagen, dann haben wir ein Werkzeug für Sicherheit und Vertrauen. Ein Modell, das etwas verschweigt oder täuscht, würde genau hier auffallen. Der J-Space ist kein Fenster in eine Seele — aber vielleicht eines in die Ehrlichkeit einer KI. Und das ist am Ende praktischer, als die Bewusstseinsdebatte vermuten lässt.
Quellen: