Ein simpler Trick sorgt in der Entwickler-Community für Aufsehen: Wer Claude mit radikal vereinfachten Systemprompts instruiert, kann seine API-Kosten um bis zu drei Viertel senken – ohne bei technischen Aufgaben spürbare Qualitätsverluste hinnehmen zu müssen.
Token-Kosten um 75 Prozent senken: Entwickler nutzen vereinfachte Systemprompts für Claude
Der Auslöser: Ein Reddit-Post mit Kettenreaktion
Ein Beitrag auf Reddit hat in der Entwickler-Community erhebliche Wellen geschlagen. Die Kernthese: Wer dem Anthropic-Modell Claude vorgibt, in knappen, grammatikalisch reduzierten Sätzen zu antworten, kann den Output-Token-Verbrauch um bis zu 75 Prozent senken – ohne nennenswerte Qualitätseinbußen bei technischen Aufgaben.
Der Post löste über 400 Kommentare sowie mehrere GitHub-Repositories aus, in denen Entwickler die Methode systematisierten.
Das Prinzip hinter dem Ansatz
Die Idee ist technisch simpel: Statt Claude in natürlichsprachlichen, ausformulierten Sätzen antworten zu lassen, wird das Modell per Systemprompt angewiesen, auf Füllwörter, Höflichkeitsformeln und erläuternde Einleitungen zu verzichten. Die Antworten wirken dadurch grammatikalisch unvollständig – Beobachter beschreiben den Stil treffend als „Höhlenmensch-Sprache” –, transportieren aber den relevanten Informationsgehalt zuverlässig.
Ein typischer Systemprompt dieser Art sieht so aus:
„Skip explanations. No politeness. Use short fragments. Answer only what asked.”
Das Modell liefert daraufhin komprimierte Ausgaben, die für automatisierte Pipelines oder Code-Generierungsaufgaben oft vollständig ausreichen.
Wo die Methode funktioniert – und wo nicht
Die Einsparungen fallen besonders deutlich in agentic Workflows aus – also in mehrstufigen Prozessen, bei denen ein Modell wiederholt aufgerufen wird:
- Code-Review-Pipelines
- Automatisierte Datenverarbeitung
- Interne Klassifizierungsaufgaben
Hier summieren sich die Einsparungen pro API-Call zu substanziellen Kostenunterschieden, da token-basierte Abrechnungsmodelle direkt an die Ausgabelänge gekoppelt sind.
Für Anwendungsfälle mit Endnutzer-Kontakt – Chatbots, Kundenkommunikation oder erklärende Dokumentation – ist der Ansatz dagegen weniger geeignet. Verkürzte, fragmentarische Antworten können in diesen Kontexten als unprofessionell wahrgenommen werden oder wichtige Zusammenhänge unterschlagen.
Einordnung aus technischer Perspektive
Aus Sicht des Prompt Engineering ist der Befund nicht überraschend:
Large Language Models orientieren sich bei der Ausgabelänge stark an impliziten Erwartungen, die durch die Formulierung des Prompts entstehen. Förmliche, ausführliche Systemprompts begünstigen ausführliche Antworten – knappe, direktive Anweisungen führen zu knappen Ausgaben.
Dass dies als „Trick” wahrgenommen wird, liegt weniger an einer technischen Entdeckung als daran, dass viele Entwickler Standardprompts verwenden, die unbewusst auf ausführliche Antworten ausgelegt sind.
Anthropic selbst hat sich zu dieser spezifischen Methode bisher nicht öffentlich geäußert. Grundsätzlich empfiehlt das Unternehmen in seiner offiziellen Dokumentation ohnehin präzise, strukturierte Prompts – womit der Ansatz im Einklang mit etablierten Best Practices steht.
Relevanz für den deutschsprachigen Unternehmenseinsatz
Für deutsche Unternehmen, die Claude oder vergleichbare Modelle über API-Zugänge in produktiven Systemen betreiben, lohnt eine Überprüfung bestehender Systemprompts. Insbesondere in internen Automatisierungslösungen, bei denen keine menschlichen Empfänger die Ausgaben direkt lesen, können gezielte Kürzungen der Antwortlänge die monatlichen API-Kosten messbar reduzieren.
Der Aufwand ist dabei gering: Ein überarbeiteter Systemprompt lässt sich in bestehende Deployments in der Regel ohne Architekturänderungen integrieren. Angesichts der aktuellen Preisstrukturen großer Modellanbieter bleibt Token-Effizienz ein praktisch relevanter Hebel für die Wirtschaftlichkeit KI-gestützter Prozesse.
Quelle: Decrypt AI
