Skip to content
ByteWire
  • KI-Regulierung
  • KI-Infrastruktur
  • KI-Sicherheit
  • KI-Investitionen
  • KI-Agenten

Alibabas Qwen-Team verbessert Reasoning-Fähigkeiten mit neuem Trainingsalgorithmus

05.04.2026
KI-Reasoning und neuronale Netzwerke

Alibabas Forschungsteam präsentiert mit FIPO einen Trainingsalgorithmus, der KI-Modelle zu längeren und strukturierteren Denkprozessen bringt – ohne größere Modelle oder mehr Trainingsdaten zu benötigen.

Alibabas Qwen-Team verbessert Reasoning-Fähigkeiten mit neuem Trainingsalgorithmus

Das Qwen-Team von Alibaba hat einen neuen Algorithmus vorgestellt, der die Denktiefe von KI-Modellen beim Reasoning signifikant verbessert. Der Ansatz adressiert eine strukturelle Schwäche im bisherigen Reinforcement Learning und soll Modelle dazu bringen, komplexe Argumentationsketten deutlich länger und gründlicher zu verfolgen.

Das Problem mit gleichgewichteten Tokens

Aktuelle Reasoning-Modelle werden mithilfe von Reinforcement Learning trainiert – einem Verfahren, bei dem das Modell für korrekte Antworten belohnt wird. Das grundlegende Problem dabei: Alle erzeugten Tokens, also alle Wortbestandteile einer Antwort, werden dabei gleich behandelt. Ob ein Token am Anfang einer Argumentationskette steht oder am Ende, ob er logisch entscheidend ist oder wenig zur Lösung beiträgt – das bisherige Verfahren unterscheidet nicht.

Das führt in der Praxis dazu, dass Modelle keine Anreize haben, besonders wichtige Zwischenschritte in einer komplexen Überlegung besonders sorgfältig zu gewichten. Das Ergebnis sind verkürzte Denkprozesse, die bei anspruchsvolleren Aufgaben zu Fehlern neigen.

Schrittweise Bewertung statt pauschaler Belohnung

Der neue Algorithmus des Qwen-Teams, den die Forscher als FIPO bezeichnen, verfolgt einen anderen Ansatz: Jeder Schritt in der Argumentationskette wird danach bewertet, wie stark er den weiteren Verlauf der Überlegung beeinflusst. Tokens und Zwischenschritte, die für den nachfolgenden Denkprozess besonders relevant sind, erhalten eine höhere Gewichtung im Training.

Das Modell lernt dadurch, kritische Entscheidungspunkte in einer Argumentationskette zu erkennen – und ihnen mehr Aufmerksamkeit zu widmen.

Die praktische Konsequenz ist messbar: Laut Angaben des Qwen-Teams verdoppelt sich die durchschnittliche Länge der generierten Denkprozesse gegenüber dem bisherigen Verfahren. Längere Reasoning-Ketten gelten in der Forschung als Indikator für tieferes, strukturierteres Problemlösen.

Leistungsgewinne auf etablierten Benchmarks

In ersten Tests zeigt FIPO deutliche Verbesserungen auf gängigen Reasoning-Benchmarks, darunter Mathematik- und Logikaufgaben, bei denen mehrstufiges Schlussfolgern erforderlich ist. Die Methode wurde auf bestehenden Qwen-Modellen erprobt und soll sich grundsätzlich auf unterschiedliche Modellgrößen anwenden lassen.

Kein größeres Modell, keine zusätzlichen Trainingsdaten – die Verbesserung ergibt sich allein aus der veränderten Trainingslogik.

Das macht den Ansatz auch unter Kostengesichtspunkten attraktiv. Trainingseffizienz ist ein zunehmend zentrales Thema in der KI-Forschung, da die Rechenkosten für leistungsstarke Modelle erheblich sind.

Einordnung für deutsche Unternehmen

Für Unternehmen, die KI-gestützte Systeme für komplexe Aufgaben – etwa juristische Analyse, technische Fehlerdiagnose oder mehrstufige Planungsprozesse – einsetzen oder evaluieren, ist die Entwicklung relevant. Bessere Reasoning-Fähigkeiten bedeuten in der Praxis zuverlässigere Ergebnisse bei Aufgaben, die sequenzielle Schlussfolgerungen erfordern.

Die Qwen-Modelle von Alibaba sind in Open-Source-Varianten verfügbar und damit auch für europäische Unternehmen zugänglich, die KI-Kapazitäten ohne Abhängigkeit von US-amerikanischen Anbietern aufbauen wollen. Ob und wann FIPO in öffentlich verfügbare Qwen-Versionen einfließt, hat das Team bislang nicht kommuniziert. Die Veröffentlichung des Algorithmus als Forschungsbeitrag legt jedoch nahe, dass eine breitere Implementierung mittelfristig geplant ist.


Quelle: The Decoder

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Post navigation

← Google-Studie: KI-Benchmarks bilden menschliche Meinungsvielfalt unzureichend ab
KI-Spielzeug auf dem Vormarsch: Sicherheitsnachweise vielfach ausstehend →

Das könnte Sie auch interessieren

a computer chip with the letter a on top of it

Anonyme KI-Modelle und digitale Lehre: Zwei Seiten einer beschleunigten Entwicklung

24.08.2026

Die KI-Landschaft zeigt zwei gegenläufige Tendenzen: Während unbekannte Entwickler hochperformante Modelle im Verborgenen testen, etabliert eine …

Weiterlesen »
a computer chip with the letter a on top of it

KI-Backlash zwingt Tech-Konzerne zur Nachbesserung – Publisher stehen vor strategischer Weggabelung

20.08.2026

Die wachsende Ablehnung gegenüber generativer KI verändert das Machtgefüge zwischen Plattformen, Publishern und Nutzern. Während Silicon …

Weiterlesen »
a computer chip with the letter a on top of it

Studie: Jeder dritte neue Webseiteninhalt zeigt KI-Spuren

20.08.2026

Die Qualität KI-generierter Inhalte gerät zunehmend unter Druck: Eine Studie belegt, dass seit dem Launch von …

Weiterlesen »

Suche

Tags

Cybersecurity Cybersicherheit Datenschutz & Compliance Enterprise-KI fin Generative KI KI KI & Gesellschaft KI-Agenten KI-Automatisierung KI-Entwicklung KI-Entwicklungstools KI-Forschung KI-Geopolitik KI-Governance KI-Hardware KI-Infrastruktur KI-Investitionen KI-Modelle KI-Plattformstrategie KI-Politik KI-Produktentwicklung KI-Produktivität KI-Produktivitätstools KI-Produktstrategie KI-Regulierung KI-Risiken KI-Sicherheit KI-Strategie KI-Tools KI-Unternehmensstrategie KI-Unternehmensstrategien KI im Gesundheitswesen Open-Source-KI pol Quantencomputing Raumfahrt Regulierung Robotik Robotik & Automatisierung sci Tech-Regulierung Unternehmensstrategie wi wt
  • Impressum

© 2026 bytewire.ai