Skip to content
ByteWire
  • KI-Regulierung
  • KI-Infrastruktur
  • KI-Sicherheit
  • KI-Investitionen
  • KI-Agenten

Alibaba veröffentlicht Qwen3.5-Omni: Multimodales Modell verarbeitet Text, Audio, Bilder und Video

31.03.2026
Alibabas multimodales KI-Modell Qwen3.5-Omni verarbeitet Text, Audio, Bild und Video simultan

Alibaba tritt mit Qwen3.5-Omni in den wachsenden Markt omnimodaler KI-Modelle ein – und stellt dabei direkt Googles Gemini in den Schatten. Das neue Modell verarbeitet Text, Bilder, Audio und Video nicht nacheinander, sondern gleichzeitig, und kann sogar Code auf Basis gesprochener Anweisungen und Videoeingaben generieren.

Alibaba veröffentlicht Qwen3.5-Omni: Multimodales Modell verarbeitet Text, Audio, Bild und Video gleichzeitig

Alle Modalitäten in einem Modell

Alibaba hat mit Qwen3.5-Omni ein neues omnimodales Large Language Model vorgestellt, das Text, Bilder, Audio und Video als Eingabe verarbeitet – und dabei gleichzeitig sowohl Text als auch gesprochene Sprache ausgeben kann. Die entscheidende Neuerung liegt nicht im bloßen Unterstützen mehrerer Formate, sondern in der parallelen Verarbeitung: Ein Nutzer kann ein Video einspielen, eine gesprochene Frage stellen und erhält sowohl eine schriftliche als auch eine gesprochene Antwort – ohne Wechsel zwischen verschiedenen Spezialsystemen.

„Die simultane Verarbeitung mehrerer Modalitäten ist technisch anspruchsvoller als das sequenzielle Abarbeiten, weil alle Eingabetypen gemeinsam im Modell repräsentiert und verknüpft werden müssen.”

Alibaba positioniert Qwen3.5-Omni explizit als Konkurrenz zu Googles Gemini-Reihe. In internen Benchmarks soll das Modell bei Audio-Verständnis und Sprachverarbeitung messbar besser abschneiden als Gemini 2.5 Pro. Unabhängige Prüfungen dieser Vergleiche stehen noch aus.


Codierung per Sprache und Video

Eine der bemerkenswertesten Fähigkeiten ist die sogenannte audiovisuelle Code-Generierung: Entwickler können ein Video zeigen – etwa einen laufenden Prozess oder eine Benutzeroberfläche – und gleichzeitig per Sprache beschreiben, welche Funktionalität sie benötigen. Das Modell generiert daraufhin entsprechenden Code.

Dieser Ansatz könnte besonders dann relevant werden, wenn Entwickler Bildschirmaufnahmen von Fehlern oder unbekannten Systemen direkt als Kontext nutzen möchten – ohne aufwändig zu dokumentieren oder zu verschriftlichen.


Technische Architektur und Verfügbarkeit

Über die genaue Parameterzahl und Architekturdetails hat Alibaba zum Zeitpunkt der Veröffentlichung noch keine vollständigen Informationen bereitgestellt. Das Modell soll über die Qwen-Plattform und voraussichtlich auch über Alibaba Cloud zugänglich sein.

Ob und wann eine Open-Source-Variante erscheint, ist noch nicht kommuniziert worden – bei früheren Qwen-Modellen hatte Alibaba jedoch regelmäßig gewichtige Versionen zur freien Nutzung veröffentlicht.


Einordnung im Wettbewerbsfeld

Omnimodale Modelle gelten derzeit als einer der zentralen Entwicklungsstränge im LLM-Bereich. Neben Google arbeiten auch OpenAI mit GPT-4o sowie Meta und mehrere Startups an vergleichbaren Ansätzen. Alibabas Qwen-Serie hat sich in den vergangenen Monaten als ernstzunehmende Alternative zu westlichen Modellen etabliert – insbesondere was Effizienz und Mehrsprachigkeit betrifft.

Für deutsche Unternehmen, die multimodale KI-Anwendungen evaluieren, ist Qwen3.5-Omni aus mehreren Gründen relevant:

  • Reduzierte Systemkomplexität: Audio, Video und Text lassen sich in einer einzigen API-Anfrage verarbeiten.
  • Unified-Model-Ansatz: Wer Kundengespräche transkribieren, analysieren und mit Bilddaten aus Produktionsprozessen verknüpfen möchte, profitiert von einem einheitlichen Modell gegenüber mehreren spezialisierten Systemen.
  • Offene Datenschutzfragen: Entscheidend wird sein, ob Alibaba On-Premise-Betrieb oder Hosting in europäischen Rechenzentren anbietet – eine Voraussetzung für viele DSGVO-konforme Deployments.

Quelle: The Decoder – Sehen, Hören, Coden: Alibabas Qwen3.5-Omni macht alles gleichzeitig

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Dieser Artikel wurde von einer KI auf Basis von Berichten internationaler Medien zusammengefasst und auf Deutsch verfasst. Er wurde nicht von einer menschlichen Redaktion geprüft. Kennzeichnung gemäß EU AI Act Art. 50.

Post navigation

← Nebius Group baut eines der größten KI-Rechenzentren Europas in Finnland
Proton Workspace: Schweizer Anbieter positioniert sich als datenschutzkonforme Büro-Alternative →

Das könnte Sie auch interessieren

a computer chip with the letter a on top of it

Anonyme KI-Modelle und digitale Lehre: Zwei Seiten einer beschleunigten Entwicklung

24.08.2026

Die KI-Landschaft zeigt zwei gegenläufige Tendenzen: Während unbekannte Entwickler hochperformante Modelle im Verborgenen testen, etabliert eine …

Weiterlesen »
a computer chip with the letter a on top of it

KI-Backlash zwingt Tech-Konzerne zur Nachbesserung – Publisher stehen vor strategischer Weggabelung

20.08.2026

Die wachsende Ablehnung gegenüber generativer KI verändert das Machtgefüge zwischen Plattformen, Publishern und Nutzern. Während Silicon …

Weiterlesen »
a computer chip with the letter a on top of it

Studie: Jeder dritte neue Webseiteninhalt zeigt KI-Spuren

20.08.2026

Die Qualität KI-generierter Inhalte gerät zunehmend unter Druck: Eine Studie belegt, dass seit dem Launch von …

Weiterlesen »

Suche

Tags

Cybersecurity Cybersicherheit Datenschutz & Compliance Enterprise-KI fin Generative KI KI KI & Gesellschaft KI-Agenten KI-Automatisierung KI-Entwicklung KI-Entwicklungstools KI-Forschung KI-Geopolitik KI-Governance KI-Hardware KI-Infrastruktur KI-Investitionen KI-Modelle KI-Plattformstrategie KI-Politik KI-Produktentwicklung KI-Produktivität KI-Produktivitätstools KI-Produktstrategie KI-Regulierung KI-Risiken KI-Sicherheit KI-Strategie KI-Tools KI-Unternehmensstrategie KI-Unternehmensstrategien KI im Gesundheitswesen Open-Source-KI pol Quantencomputing Raumfahrt Regulierung Robotik Robotik & Automatisierung sci Tech-Regulierung Unternehmensstrategie wi wt
  • Impressum

© 2026 bytewire.ai