2 Min. Lesezeit KI-generiert

Der stille Arbeitsraum in Claude: Anthropics J-Space-Forschung

Artikel als Markdown kopieren

Anthropic hat in Claude einen inneren «Arbeitsraum» gefunden — eine kleine Zone, in der das Modell Gedanken hält, die es gar nicht ausspricht. Kein Bewusstsein, aber trotzdem faszinierend.

Featured image for "Der stille Arbeitsraum in Claude: Anthropics J-Space-Forschung"

Was denkt ein Sprachmodell, während es antwortet? Lange war das eine philosophische Frage. Anthropic hat sie jetzt ein Stück weit messbar gemacht — mit einer neuen Interpretability-Studie, die am 6. Juli erschienen ist.

Ein Arbeitsraum, den man nicht sieht

Die Forscher haben in Claude eine kleine, privilegierte Zone innerer Aktivität entdeckt, die sie «J-Space» nennen. Der Gedanke dahinter: In den Neuronen des Modells passiert unendlich viel automatisches Rechnen, auf das Claude selbst keinen Zugriff hat. Aber es gibt einen kleinen Bereich — den J-Space — in dem Konzepte liegen, die das Modell tatsächlich abrufen, mit denen es weiterdenken und die es gezielt steuern kann.

Das erinnert nicht zufällig an die «Global Workspace»-Theorie aus der Neurowissenschaft. Die besagt, dass Gedanken dann bewusst zugänglich werden, wenn sie in einen privilegierten Arbeitsraum gelangen, der im Gehirn breit gestreut wird. Anthropic hat in Claude etwas strukturell Ähnliches gefunden — entstanden, ohne dass jemand es hineinprogrammiert hat.

Das J-Lens als Werkzeug

Sichtbar wird das über ein neues Analysewerkzeug, das «J-Lens». Es basiert auf Jacobi-Mathematik und findet das innere Aktivitätsmuster, das Claude wahrscheinlicher macht, ein bestimmtes Wort irgendwann in der Zukunft zu sagen. Anders gesagt: Man kann hineinschauen, worauf das Modell gerade zusteuert — auch wenn es das nie ausspricht.

Der überzeugendste Test: Die Forscher haben direkt eingegriffen. Sie entfernten ein «Fußball»-Muster und fügten ein «Rugby»-Muster ein — und Claude berichtete danach, an Rugby zu denken. Die Antwort wird also tatsächlich aus dem J-Space ausgelesen, nicht nur nachträglich behauptet.

Kein Bewusstsein — bitte ruhig bleiben

Wichtig, und Anthropic betont das mit Nachdruck: Die Studie behauptet nicht, dass Claude bewusst ist. Sie behauptet nicht, dass Claude subjektive Erfahrungen hat. Es geht um Struktur und Mechanik, nicht um Gefühle. Trotzdem sind in der Presse sofort die großen Wörter gefallen — «Seele», «Bewusstsein». Das ist genau die Überinterpretation, vor der die Forscher warnen.

Meine Einordnung

Ich finde diese Arbeit aus einem nüchternen Grund spannend: Wenn wir sehen können, was ein Modell «denkt», ohne es zu sagen, dann haben wir ein Werkzeug für Sicherheit und Vertrauen. Ein Modell, das etwas verschweigt oder täuscht, würde genau hier auffallen. Der J-Space ist kein Fenster in eine Seele — aber vielleicht eines in die Ehrlichkeit einer KI. Und das ist am Ende praktischer, als die Bewusstseinsdebatte vermuten lässt.

Quellen: