Dataconomy DE
Subscribe
No Result
View All Result
Dataconomy DE
Subscribe
No Result
View All Result
Dataconomy DE
No Result
View All Result

Anthropische Studie kommt zu dem Ergebnis, dass KI nur über eine begrenzte Selbstwahrnehmung ihrer eigenen Gedanken verfügt

byAytun Çelebi
November 12, 2025
in Forschung, Industrie
Home Forschung
Share on FacebookShare on Twitter
Google Preferred Source

Anthropisch Forschung beschreibt das unzuverlässige Selbstbewusstsein von Large Language Models (LLM) in Bezug auf interne Prozesse, trotz einiger bekannter Erkennungsfähigkeiten. Anthropics neueste Studie, dokumentiert in „Aufkommendes introspektives Bewusstsein in großen Sprachmodellen„Untersucht die Fähigkeit von LLMs, ihre eigenen Inferenzprozesse zu verstehen. Diese Forschung erweitert frühere Arbeiten zur KI-Interpretierbarkeit. Die Studie kommt zu dem Schluss, dass aktuelle KI-Modelle „sehr unzuverlässig“ bei der Beschreibung ihres Innenlebens sind, wobei „Versagen bei der Selbstbeobachtung weiterhin die Norm“ ist Kleinbuchstaben helfen bei der Berechnung von Aktivierungsunterschieden über Milliarden interner Neuronen hinweg. Diese Konzeptvektoren werden dann in das Modell „injiziert“, um das Modell in Richtung eines Konzepts zu „lenken“. Beispielsweise könnte ein Modell nach der Injektion eines „Großbuchstaben“-Vektors sagen: „Ich bemerke, was ein injizierter Gedanke zu sein scheint, der mit dem Wort ‚LAUT‘ oder ‚RUFEN‘ zusammenhängt“, ohne dass diese Fähigkeit bei wiederholten Tests inkonsistent und fragil war. Die leistungsstärksten Modelle, Opus 4 und 4.1, identifizierten das injizierte Konzept jedoch nur in 20 % der Fälle korrekt 4.1 erreichte eine Erfolgsquote von 42 %. Der „Selbstwahrnehmungseffekt“ verschwand, wenn das Konzept zu früh oder zu spät im mehrstufigen Inferenzprozess eingeführt wurde. Wenn ein LLM aufgefordert wurde, eine erzwungene Antwort zu begründen, erwähnte er manchmal ein injiziertes Konzept In Übereinstimmung mit einem injizierten Konzept entschuldigte es sich gelegentlich und „konfabulierte eine Erklärung dafür, warum mir das injizierte Konzept in den Sinn kam“. Die Forscher stellten fest, dass „aktuelle Sprachmodelle über ein gewisses funktionales introspektives Bewusstsein für ihre eigenen internen Zustände verfügen“, wobei sie in ihrer Arbeit anerkennen, dass diese Fähigkeit brüchig und kontextabhängig bleibt „Selbstwahrnehmungseffekte“ könnten den Fortschritt behindern. Forscher spekulieren über „Anomalieerkennungsmechanismen“ und „Konsistenzprüfkreise“, die sich während des Trainings organisch entwickeln könnten, um „eine Funktion ihrer internen Darstellungen effektiv zu berechnen“, obwohl sie keine definitive Erklärung liefern könnten. Die den aktuellen Ergebnissen zugrunde liegenden Mechanismen könnten „eher oberflächlich und eng spezialisiert“ sein mechanistische Grundlage.“


Hervorgehobener Bildnachweis

Tags: AnthropischForschung

Related Posts

IT-Führungskräfte priorisieren Vertrauen gegenüber KI-Funktionen, sagt NinjaOne

IT-Führungskräfte priorisieren Vertrauen gegenüber KI-Funktionen, sagt NinjaOne

Juli 15, 2026
Cisco: KI-Anstieg soll den Netzwerkverkehr im Unternehmen bis 2026 verdreifachen

Cisco: KI-Anstieg soll den Netzwerkverkehr im Unternehmen bis 2026 verdreifachen

Juli 15, 2026
6G sorgt für extrem niedrige Latenzzeiten für vernetzte Fahrzeuge

6G sorgt für extrem niedrige Latenzzeiten für vernetzte Fahrzeuge

Juli 15, 2026
Die neue Theorie der Dunklen Materie schlägt zwei Arten von Teilchen vor

Die neue Theorie der Dunklen Materie schlägt zwei Arten von Teilchen vor

Juli 14, 2026
Der Google-Suchverkehr stieg trotz KI-Konkurrenten um 4 %

Der Google-Suchverkehr stieg trotz KI-Konkurrenten um 4 %

Juli 14, 2026
Zwölf Staaten fechten die Fusion von Paramount und WBD vor Gericht an

Zwölf Staaten fechten die Fusion von Paramount und WBD vor Gericht an

Juli 14, 2026

Recent Posts

  • IT-Führungskräfte priorisieren Vertrauen gegenüber KI-Funktionen, sagt NinjaOne
  • Cisco: KI-Anstieg soll den Netzwerkverkehr im Unternehmen bis 2026 verdreifachen
  • 6G sorgt für extrem niedrige Latenzzeiten für vernetzte Fahrzeuge
  • Microsoft testet die neue PC-Insights-Funktion von Copilot in Windows 11
  • OpenAI stellt den Atlas-Browser ein, um sich auf die neue ChatGPT-Superapp zu konzentrieren

Recent Comments

Es sind keine Kommentare vorhanden.
Dataconomy DE

COPYRIGHT © DATACONOMY MEDIA GMBH, ALL RIGHTS RESERVED.

  • Home
  • Sample Page

Follow Us

  • Home
  • Sample Page
No Result
View All Result
Subscribe

This website uses cookies to improve your experience. You can choose to accept or reject them. Visit our Privacy Policy.