Skip to content
ByteWire
  • Autonomes Fahren & Mobilität
  • Cybersicherheit
  • Datenschutz & Datenpolitik
  • Energie & Nachhaltigkeit
  • Enterprise-KI & Produktivität
  • Geopolitik & Tech-Souveränität
  • Gesundheit & Life Sciences
  • Investitionen & Finanzierung
  • KI & Arbeitswelt
  • KI-Agenten & Automatisierung
  • KI-Infrastruktur & Hardware
  • KI-Modelle & Forschung
  • KI-Regulierung & Recht
  • KI-Unternehmen & Strategie
  • Raumfahrt & Weltraum
  • Robotik & Physische KI
  • Sicherheit & Verteidigung

Anthropic lässt Claude psychiatrisch begutachten

10.04.2026
Ein Psychiater sitzt einem Gesprächspartner gegenüber, auf dem Tisch liegt ein aufgeschlagenes Notizbuch

Anthropic hat sein KI-Modell Claude über rund 20 Stunden psychiatrischen Interviews unterzogen – ein ungewöhnlicher Schritt, der die Grenzen klassischer KI-Sicherheitsevaluierung sichtbar macht und die Frage aufwirft, was „psychologische Stabilität” bei einem Sprachmodell überhaupt bedeutet.

Anthropic lässt Claude von einem Psychiater begutachten

Strukturierte Evaluation statt interner Einschätzung

Anthropic beauftragte nach eigenen Angaben einen echten Psychiater, Claude in ausgedehnten Gesprächssitzungen auf psychologische Belastbarkeit zu prüfen. Die Gespräche sollten unter anderem zeigen, wie das Modell mit Provokationen, existenziellen Fragen zu seiner eigenen Natur und destabilisierenden Gesprächsmustern umgeht.

Das Ergebnis dieser Untersuchung floss direkt in das Training des aktuellen Modells ein, das intern unter dem Codenamen „Mythos” entwickelt wurde.

Anthropic bezeichnet „Mythos” als das bislang „psychologisch gefestigtste Modell”, das das Unternehmen trainiert hat – konsistenter im Umgang mit gezielten Manipulationsversuchen als alle Vorgänger.


Warum psychologische Stabilität relevant ist

Die Frage, wie stabil ein Large Language Model unter Druck bleibt, ist keine theoretische. Nutzer und Unternehmen setzen KI-Assistenten zunehmend in sensiblen Kontexten ein – von der Kundenbetreuung über HR-Prozesse bis hin zur rechtlichen oder medizinischen Vorprüfung.

Modelle, die sich durch persistentes Nachfragen, emotional aufgeladene Formulierungen oder sogenannte Jailbreak-Versuche aus der Bahn bringen lassen, stellen ein praktisches Sicherheitsrisiko dar.

Anthropic versucht mit dem psychiatrischen Evaluierungsansatz, eine Lücke zu schließen, die rein technische Benchmarks offen lassen:

Standardtests messen Genauigkeit, Faktentreue oder Aufgabenerfüllung – aber kaum das Verhalten eines Modells unter sozialem oder emotionalem Druck über einen längeren Gesprächsverlauf hinweg.


Methodik mit offenen Fragen

Trotz des methodisch interessanten Ansatzes bleiben kritische Punkte ungeklärt:

  • Konzeptionelle Übertragbarkeit: Psychiatrische Kategorien wurden für menschliches Verhalten entwickelt. Ein Modell hat keine Biografie, keine Kindheitserfahrungen und keinen Körper – die Übertragung ist daher nicht ohne Weiteres belastbar.
  • Fehlende Unabhängigkeit: Das Verfahren ist unternehmensintern. Genaue Methodik und Ergebnisse sind nicht vollständig öffentlich zugänglich, eine unabhängige Überprüfung damit nur eingeschränkt möglich.

Das ist ein grundsätzliches Problem bei vielen KI-Sicherheitsevaluierungen: Sie werden von denselben Unternehmen durchgeführt, die ein kommerzielles Interesse an positiven Ergebnissen haben.


Einordnung für deutsche Unternehmen

Für Unternehmen im deutschsprachigen Raum, die KI-Modelle in kritischen Geschäftsprozessen einsetzen oder planen einzusetzen, ist dieser Ansatz aus zwei Gründen relevant:

  1. Verhaltensevaluierung als neuer Standard: Führende Anbieter gehen zunehmend über technische Leistungsmetriken hinaus – ein Kriterium, das bei Anbieterwahl und Risikoprüfung berücksichtigt werden sollte.
  2. Compliance und Haftung: Die Robustheit eines Modells gegenüber Manipulation – auch unbeabsichtigter – hat direkte Auswirkungen auf rechtliche Verantwortlichkeit. Der EU AI Act fordert für Hochrisiko-Anwendungen explizit Nachweise zur Zuverlässigkeit und Robustheit eingesetzter Systeme.

Evaluierungsansätze wie der von Anthropic könnten künftig als Teil solcher Nachweise regulatorisch relevant werden.


Quelle: Ars Technica AI

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Post navigation

← Cloudflare stellt EmDash vor: Neues CMS zielt auf WordPress-Marktanteile
OpenAI führt 100-Dollar-Tarif für ChatGPT-Poweruser ein →

Das könnte Sie auch interessieren

a computer chip with the letter a on top of it

DeepMind-Alumni positionieren KI-Forschungsagenten als Alternative zu OpenAI und Anthropic

22.08.2026

Das Londoner Startup Inherent, gegründet von ehemaligen DeepMind-Mitarbeitern, beansprucht mit seinem KI-System eine neue Leistungsstufe bei …

Weiterlesen »
the entrance to a restaurant with glass doors

Model Routing und KI-Orchestrierung: Wie Unternehmen den LLM-Zugang professionalisieren

20.08.2026

Die Zersplitterung des Large Language Model-Marktes treibt die Entwicklung spezialisierter Infrastrukturschichten voran. Unternehmen wie Ramp setzen …

Weiterlesen »
a computer chip with the letter a on top of it

Meta baut KI-Ökosystem für Endnutzer massiv aus

20.08.2026

Meta treibt die Expansion seiner KI-Plattformstrategie mit zwei neuen Produkten voran: Die Einführung der experimentellen App …

Weiterlesen »

Suche

Kategorien

  • Allgemein
  • Autonomes Fahren & Mobilität
  • Cybersicherheit
  • Datenschutz & Datenpolitik
  • Energie & Nachhaltigkeit
  • Enterprise-KI & Produktivität
  • Geopolitik & Tech-Souveränität
  • Gesundheit & Life Sciences
  • Investitionen & Finanzierung
  • KI & Arbeitswelt
  • KI-Agenten & Automatisierung
  • KI-Infrastruktur & Hardware
  • KI-Modelle & Forschung
  • KI-Regulierung & Recht
  • KI-Unternehmen & Strategie
  • Raumfahrt & Weltraum
  • Robotik & Physische KI
  • Sicherheit & Verteidigung
  • Impressum

© 2026 bytewire.ai