Skip to content
ByteWire
  • Autonomes Fahren & Mobilität
  • Cybersicherheit
  • Datenschutz & Datenpolitik
  • Energie & Nachhaltigkeit
  • Enterprise-KI & Produktivität
  • Geopolitik & Tech-Souveränität
  • Gesundheit & Life Sciences
  • Investitionen & Finanzierung
  • KI & Arbeitswelt
  • KI-Agenten & Automatisierung
  • KI-Infrastruktur & Hardware
  • KI-Modelle & Forschung
  • KI-Regulierung & Recht
  • KI-Unternehmen & Strategie
  • Raumfahrt & Weltraum
  • Robotik & Physische KI
  • Sicherheit & Verteidigung

Neuer Benchmark deckt systematisches Rateverhalten bei multimodalen KI-Modellen auf

11.04.2026
Multimodales KI-Modell analysiert unscharfes Bild

Wenn Bilder fehlen oder unscharf sind, sollten KI-Systeme nachfragen – tun sie aber nicht. Ein neuer Benchmark legt offen, wie verbreitet das stille Raten bei multimodalen Sprachmodellen ist, und warum das für Unternehmen ein ernstes Risiko darstellt.

Neuer Benchmark deckt systematisches Rateverhalten bei multimodalen KI-Modellen auf

Ein neu veröffentlichter Benchmark namens ProactiveBench zeigt, dass multimodale Large Language Models bei unzureichenden oder fehlenden Bilddaten nicht nach Klärung fragen, sondern stattdessen Antworten generieren – auch wenn die visuelle Grundlage dafür fehlt. Von 22 getesteten Modellen zeigte keines ein nennenswertes proaktives Nachfrageverhalten.


Was ProactiveBench misst

Multimodale Sprachmodelle können Text und Bilder gleichzeitig verarbeiten. In der Praxis werden solche Systeme etwa für die automatisierte Qualitätsprüfung, die Analyse von Produktfotos oder die Auswertung medizinischer Aufnahmen eingesetzt. ProactiveBench untersucht gezielt, wie sich diese Modelle verhalten, wenn die visuelle Information unvollständig, verdeckt oder qualitativ unzureichend ist – Situationen, die im realen Einsatz regelmäßig auftreten.

Die Kernfrage des Benchmarks:

Erkennt ein Modell, dass es auf Basis der vorliegenden Bilddaten keine verlässliche Aussage treffen kann – und fordert es dann proaktiv weitere Informationen an? Oder produziert es dennoch eine Antwort?

Ergebnis: Raten statt Nachfragen

Die Auswertung fällt eindeutig aus. Nahezu alle 22 getesteten Modelle neigten dazu, auch bei visuell unzureichenden Eingaben Antworten zu liefern, statt auf die Einschränkungen hinzuweisen oder Rückfragen zu stellen. Dieses Verhalten entspricht dem bekannten Phänomen der Halluzination, allerdings in einer spezifischen Ausprägung: Die Modelle kompensieren fehlende Wahrnehmungsdaten mit sprachlich kohärenten, aber inhaltlich nicht belegbaren Ausgaben.

Ein System, das bei einem unscharfen Produktfoto trotzdem eine Fehlerklassifikation ausgibt, kann in automatisierten Prozessketten zu Fehlentscheidungen führen – ohne dass dies für den Anwender erkennbar ist.

Das ist insofern problematisch, als Nutzer in vielen Anwendungsszenarien davon ausgehen, dass ein Modell seine eigenen Grenzen kennt.

Reinforcement Learning als möglicher Lösungsansatz

Die Forschenden hinter ProactiveBench haben auch einen möglichen Ausweg erprobt: Ein einfaches Training mittels Reinforcement Learning soll Modelle dazu bringen, bei unzureichender visueller Information aktiv nachzufragen. Erste Ergebnisse zeigen, dass dieser Ansatz das Nachfrageverhalten messbar verbessern kann – ohne die allgemeine Modellleistung signifikant zu beeinträchtigen.

Das deutet darauf hin, dass das Problem weniger in der Architektur der Modelle liegt als im Trainingsverfahren: Aktuelle Modelle wurden primär darauf optimiert, Antworten zu produzieren – nicht darauf, Unsicherheit zu kommunizieren oder fehlende Informationen zu identifizieren.

Einordnung für Unternehmen

Für Unternehmen, die multimodale KI-Systeme in operative Prozesse integrieren oder dies planen, liefert ProactiveBench einen wichtigen Hinweis:

Die Fähigkeit eines Modells, korrekte Antworten auf vollständige Eingaben zu produzieren, sagt wenig darüber aus, wie es mit unvollständigen oder qualitativ minderwertigen Daten umgeht.

Standardisierte Benchmarks erfassen dieses Verhalten bislang kaum. Praktisch bedeutet das: Wer KI-gestützte Bildauswertung im Einsatz hat oder plant – etwa in der Produktion, Logistik oder im Dokumentenmanagement – sollte gezielt testen, wie die verwendeten Modelle auf degradierte oder unvollständige Eingaben reagieren.

Verlässlichkeit in realen Einsatzszenarien setzt voraus, dass Systeme nicht nur bei optimalen Bedingungen korrekt funktionieren, sondern ihre eigenen Grenzen erkennbar machen. Bis entsprechende Trainingsansätze breit verfügbar sind, bleibt menschliche Überwachung an kritischen Entscheidungspunkten ein notwendiges Element im System-Design.


Quelle: The Decoder

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Post navigation

← KI-Spielzeug auf dem Markt ohne gesicherte Sicherheitsnachweise
Anschlag auf OpenAI-Chef Altman: Brandangriff auf Wohnhaus in San Francisco →

Das könnte Sie auch interessieren

a computer chip with the letter a on top of it

Anonyme KI-Modelle und digitale Lehre: Zwei Seiten einer beschleunigten Entwicklung

24.08.2026

Die KI-Landschaft zeigt zwei gegenläufige Tendenzen: Während unbekannte Entwickler hochperformante Modelle im Verborgenen testen, etabliert eine …

Weiterlesen »
a computer chip with the letter a on top of it

KI-Backlash zwingt Tech-Konzerne zur Nachbesserung – Publisher stehen vor strategischer Weggabelung

20.08.2026

Die wachsende Ablehnung gegenüber generativer KI verändert das Machtgefüge zwischen Plattformen, Publishern und Nutzern. Während Silicon …

Weiterlesen »
a computer chip with the letter a on top of it

Studie: Jeder dritte neue Webseiteninhalt zeigt KI-Spuren

20.08.2026

Die Qualität KI-generierter Inhalte gerät zunehmend unter Druck: Eine Studie belegt, dass seit dem Launch von …

Weiterlesen »

Suche

Kategorien

  • Allgemein
  • Autonomes Fahren & Mobilität
  • Cybersicherheit
  • Datenschutz & Datenpolitik
  • Energie & Nachhaltigkeit
  • Enterprise-KI & Produktivität
  • Geopolitik & Tech-Souveränität
  • Gesundheit & Life Sciences
  • Investitionen & Finanzierung
  • KI & Arbeitswelt
  • KI-Agenten & Automatisierung
  • KI-Infrastruktur & Hardware
  • KI-Modelle & Forschung
  • KI-Regulierung & Recht
  • KI-Unternehmen & Strategie
  • Raumfahrt & Weltraum
  • Robotik & Physische KI
  • Sicherheit & Verteidigung
  • Impressum

© 2026 bytewire.ai