Hinter den glänzenden KI-Produkten von Meta verbirgt sich eine weitverzweigte, kaum sichtbare Infrastruktur: Tausende schlecht bezahlte Auftragnehmer weltweit sichten und klassifizieren täglich Millionen von Internetinhalten – oft ohne zu wissen, wem ihre Arbeit letztlich zugute kommt.
Metas KI-Datenbeschaffung: Wie Scale AI im Auftrag des Konzerns Millionen von Inhalten klassifiziert
Meta greift für das Training seiner KI-Modelle auf die Dienste von Scale AI zurück – einem Unternehmen, das weltweit Auftragnehmer damit beauftragt, Internetinhalte zu sichten, zu kennzeichnen und zu kategorisieren. Ein Bericht des Guardian gibt Einblick in die wenig transparente Infrastruktur hinter dieser Datenbeschaffung, die von expliziten Inhalten bis hin zu banalen Social-Media-Aufnahmen reicht.
Crowdbasierte Datenarbeit im großen Maßstab
Scale AI organisiert sein Netzwerk über sogenannte „Tasker” – Auftragnehmer, die über Plattformen angeheuert werden und kleinteilige Datenkennzeichnungsaufgaben erledigen. Diese Personen sichten und kategorisieren große Mengen an Webinhalten, darunter Fotos aus sozialen Netzwerken, aber auch pornografisches Material und andere problematische Inhalte. Die Arbeit ist schlecht vergütet und findet in einem regulatorischen Graubereich statt, der kaum Arbeitsschutzstandards kennt.
Das Prinzip ist in der KI-Industrie weit verbreitet: Large Language Models und multimodale Systeme benötigen für ihr Training enorme Mengen annotierter Daten. Ohne menschliche Klassifizierungsarbeit sind Qualität und Sicherheit dieser Datensätze nicht gewährleistet. Scale AI hat sich als einer der größten Dienstleister in diesem Bereich positioniert und arbeitet nach eigenen Angaben mit mehreren großen Technologiekonzernen zusammen.
Undurchsichtige Auftragskette
Für die betroffenen Tasker ist häufig nicht ersichtlich, für welches Endunternehmen sie arbeiten. Die vertragliche Beziehung besteht primär mit Scale AI, nicht mit Meta. Diese mehrstufige Auftragskette erschwert die Zurechenbarkeit erheblich: Weder Datenschutzverantwortlichkeiten noch Arbeitsbedingungen lassen sich klar dem Auftraggeber zuordnen.
„Tasker werden ohne ausreichende psychologische Unterstützung mit belastenden Inhalten konfrontiert – ein strukturelles Problem, das die gesamte Branche betrifft.”
Der Bericht beschreibt Fälle, in denen Tasker ohne angemessene Begleitung mit schwer belastenden Inhalten konfrontiert wurden. Ähnliche Vorwürfe waren zuvor bereits gegen andere Content-Moderation-Dienstleister im Auftrag großer Plattformbetreiber erhoben worden, darunter Moderatoren für Facebook und YouTube.
Datenschutzrechtliche Fragen bleiben offen
Die verwendeten Trainingsdaten stammen offenbar in erheblichem Umfang aus öffentlich zugänglichen sozialen Netzwerken – darunter Inhalte, die Nutzer auf Meta-eigenen Plattformen wie Instagram und Facebook hochgeladen haben. Ob und in welchem Umfang diese Nutzung mit den Datenschutzerklärungen der Plattformen vereinbar ist, ist rechtlich nicht abschließend geklärt.
In der Europäischen Union steht Meta bereits unter Beobachtung der irischen Datenschutzbehörde DPC sowie der zuständigen Stellen in mehreren anderen Mitgliedstaaten. Die zentrale Frage lautet:
Bedarf das Training von KI-Modellen mit nutzereigenen Inhalten einer expliziten Einwilligung – und wer trägt dafür die Verantwortung?
Diese Frage ist Gegenstand laufender Verfahren und wird durch den EU AI Act zusätzlichen regulatorischen Druck erhalten.
Einordnung für deutsche Unternehmen
Für Unternehmen in Deutschland, die KI-Modelle von Meta einsetzen oder deren Einsatz planen, sind diese Entwicklungen aus mehreren Gründen relevant:
- Compliance-Risiken: Eigene Kundendaten könnten über Meta-Dienste in Trainingsprozesse einfließen.
- Lieferketten-Intransparenz: Der Fall zeigt, wie undurchsichtig die Infrastruktur hinter KI-Systemen sein kann.
- Regulatorischer Rahmen: Der EU AI Act adressiert mit seinen Anforderungen an Hochrisiko-KI-Systeme genau diese Lücken.
Wer KI-Dienste einkauft, sollte künftig stärker auf Transparenzpflichten der Anbieter bezüglich Trainingsdaten und Subunternehmen bestehen.
Quelle: The Guardian – Meta & Scale AI
