TuBrief
구독 채널
비디오
커뮤니티

Warum man für den Alleinbau von Webdiensten nicht nur Claude Sonnet verwenden sollte

TuBrief 편집팀
2026년 8월 22일
0
Computing/Software

원본 영상을 바탕으로 AI의 도움을 받아 작성했습니다. 원본 영상이 기준입니다.

Deutsch한국어EnglishEspañol中文العربيةहिन्दीFrançaisPortuguêsРусскийBahasa Indonesia

관련 영상

Gemini 3.5 Flash ist einfach nur... okay6:48

Gemini 3.5 Flash ist einfach nur... okay

Better Stack

커뮤니티의 다른 글

사내 시스템에 llm api 붙일 때 마주하는 현실적인 한계와 대응법

2026년 9월 13일

레거시 백엔드에 GPT-6 Astra 붙일 때 예산 승인과 보안 통과를 먼저 끝내는 법이 있습니다

2026년 9월 13일

에이전트끼리 대화하다 6천만 원 청구서가 나오는 이유

2026년 9월 13일

사내 RAG 벡터 검색에 Okta 권한 필터를 직접 거는 방법

2026년 9월 13일

브라우저 에이전트에게 내 구글 계정을 통째로 넘기면 안 되는 이유

2026년 9월 12일

Apple Won the AI Race

2026년 9월 12일

댓글 (0)

Log in to leave a comment

아직 작성된 글이 없습니다

© 2026 . All rights reserved.

TuBrief
구독 채널
비디오
커뮤니티
로그인

Warum man für den Alleinbau von Webdiensten nicht nur Claude Sonnet verwenden sollte

Wenn man einen Webdienst im Alleingang mit einem monatlichen Budget von unter 5 Millionen Won aufbaut und betreibt, schießen die API-Kosten bei ausschließlicher Nutzung von Top-Tier-KI-Modellen rasant in die Höhe. Wer Coding-Assistenzmodelle nur nach Benchmark-Werten auswählt, überschreitet im echten Entwicklungsumfeld bereits nach wenigen Turns das Ausgabenlimit. Wer den Token-Verbrauch je nach Arbeitsphase analysiert und die Modelle aufteilt, kann die Entwicklungsgeschwindigkeit beibehalten und die API-Ausgaben um über 30 % senken.


1. Tatsächlicher Token-Verbrauch und Berechnungsformel bei der Alleinentwicklung

Die Webentwicklung unterteilt sich in Prototyping, Erstellung der Kernlogik, Refactoring und Debugging. Geht man von durchschnittlich 50 API-Aufrufen pro Tag und 1.000 Aufrufen im Monat (basierend auf 20 Tagen) aus, variiert der Anteil der Input-Token je nach Arbeitsphase stark. In der Debugging-Phase, in der sich Fehlerprotokolle und alter Code in einem einzigen Chat-Fenster ansammeln, schießen die Input-Token auf bis zu 45.000 pro Aufruf hoch, und auch das Schreiben von Backend-Logik erfordert ein hohes Input-Volumen von rund 25.000 Token.

Entwicklungsphase Monatliche Aufrufe Ø Input-Token pro Aufruf Ø Output-Token pro Aufruf Monatliche Gesamt-Input-Token Monatliche Gesamt-Output-Token
Prototyping & Erstentwurf 150 3.000 1.500 450.000 225.000
Implementierung der Kernlogik 450 25.000 2.000 11.250.000 900.000
Refactoring & Code-Review 200 15.000 1.000 3.000.000 200.000
Debugging & Error Tracing 200 45.000 2.500 9.000.000 500.000
Monatliche Summe 1.000 -- -- 23.700.000 1.825.000

Bei der Berechnung der API-Ausgaben muss unbedingt der Preisunterschied zwischen Input- und Output-Token berücksichtigt werden. Da Output-Token Echtzeit-Rechenressourcen beanspruchen, sind sie mindestens 3- bis maximal 5-mal teurer als Input-Token. Die monatlichen Gesamtkosten werden mit folgender Formel berechnet:

ext{Cost}*{ ext{monthly}} = sum*{m} left( rac{T_{ ext{input}, m}}{1.000.000} cdot P_{ ext{input}, m} + rac{T_{ ext{cache}, m}}{1.000.000} cdot P_{ ext{cache}, m} + rac{T_{ ext{output}, m}}{1.000.000} cdot P_{ ext{output}, m} ight)

Wer alle Aufgaben mit einem einzigen Modell wie Claude 3.5 Sonnet (3,00 pro1MInput,15,00pro 1M Input, 15,00pro1MInput,15,00 pro 1M Output) bearbeitet, landet basierend auf dem monatlichen Gesamtvolumen (ca. 23,7 Mio. Inputs, ca. 1,825 Mio. Outputs) bei 98,48 $ pro Monat (ca. 135.000 Won). Das Problem entsteht, wenn sich das Gespräch verlängert und sich der Kontext anhäuft. Verdreifacht sich das Input-Volumen, übersteigen die monatlichen Ausgaben sofort 250 $. Ein Solo-Entwickler sollte KI-Obergrenzen bei 100 bis150bis 150bis150 ansetzen (weniger als 10 % des Gesamtbudgets) und in der Provider-Konsole Benachrichtigungen bei 50 % (50 $) und 80 % (80 $) sowie eine harte Abschaltung (Hard Limit) bei 100 % einrichten, um auf der sicheren Seite zu sein.


2. Ausschluss unnötiger Dateien und Prompt Caching

Füttert man den Coding-Agenten direkt mit dem gesamten Projektordner, wandern Zusatzdateien wie node_modules, dist/ oder package-lock.json mit hinein, wodurch 60 bis 70 % der Input-Token im Nirwana verschwinden. Es empfiehlt sich, das CLI-Tool Repomix zu verwenden, um gezielt nur die benötigten Business-Logik-Dateien auszuwählen.

json { "output": { "filePath": "repomix-output.xml", "style": "xml", "removeComments": true, "removeEmptyLines": true }, "ignore": { "useGitignore": true, "useDefaultPatterns": true, "customPatterns": [ "**/node_modules/<strong>", "</strong>/dist/<strong>", "</strong>/*.test.ts", "**/*.spec.ts", "<strong>/package-lock.json", "</strong>/yarn.lock", "**/*.public/<strong>", "</strong>/*.svg" ] } }

Für System-Prompts und gemeinsamen Bibliotheks-Code wird Prompt Caching eingerichtet. Bei der Anthropic Claude API greift ein Rabatt von 90 % auf den Cache-Lesepreis von 0,30 $ / 1M, wenn man bei System-Prompts ab 1.024 Token einen cache_control-Breakpoints setzt und die Anfrage innerhalb von 5 Minuten nach der Ersterstellung wiederholt.

json { "model": "claude-3-5-sonnet-20241022", "max_tokens": 2048, "system": [ { "type": "text", "text": "Der Nutzer ist ein Solo-Entwickler mit Schwerpunkt auf TypeScript und Next.js. Gib ausschließlich Code zurück, der präzisen Schnittstellenspezifikationen entspricht.", "cache_control": {"type": "ephemeral"} } ], "messages": [ { "role": "user", "content": "Inhalt der gemeinsamen DB-Schemadefinitionsdatei..." } ] }

Methoden zur Verkürzung der Prompt-Länge lassen sich in drei Schritte unterteilen:

  • Bei der Ausführung von Repomix die Option --compress übergeben, um interne Implementierungen wegzulassen und nur Schnittstellen sowie Funktionssignaturen zu extrahieren.
  • Die Flags --remove-comments und --remove-empty-lines anhängen, um Kommentare und Leerzeilen zu entfernen. Die Token-Länge sinkt dadurch um weitere 15 bis 20 %.
  • Extrahierte Codeblöcke statt in Plaintext in XML-Tags einpacken, damit das Modell beim Parsen nicht verwirrt wird.

3. Modellaufteilung für UI-Entwürfe und Backend-Logik

Es ist nicht nötig, für einfache Komponenten-Layouts oder Tailwind-CSS-Stil-Arbeiten teure Modelle einzusetzen. Für Frontend-UI-Entwürfe eignen sich Gemini 2.0 Flash (0,10 Input/1M,0,40Input / 1M, 0,40Input/1M,0,40 Output / 1M) oder GPT-4o mini (0,15 Input/1M,0,60Input / 1M, 0,60Input/1M,0,60 Output / 1M), die einen großen Kontext kostengünstig verarbeiten.

Arbeitsbereich Details zur Arbeit Empfohlenes Modell Auswahlgrund
Frontend-UI Erstellung von Tailwind CSS basierend auf Screenshots, Aufbau von HTML-Layouts Gemini 2.0 Flash Günstige multimodale Verarbeitung und schnelle Antwortgeschwindigkeit
Standard-Backend Implementierung von RESTful APIs, grundlegendes DB-CRUD, Validierung von Eingabewerten DeepSeek V3 Solide Leistung bei 1/10 der Kosten im Vergleich zu Claude
Anspruchsvolles Backend Mehrfache Transaktionen, Concurrency Control, komplexes Refactoring, Sicherheitsüberprüfung Claude 3.5 Sonnet Präziser Austausch, wenn bei kleineren Modell wiederholt Fehler auftreten

Alltägliche CRUD-Vorgänge oder einmalige API-Logik werden mit DeepSeek V3 (0,25 Input/1M,0,95Input / 1M, 0,95Input/1M,0,95 Output / 1M) umgesetzt, dessen Preis bei einem Zehntel von Claude 3.5 Sonnet liegt. Erst wenn bei kniffligem Code – wie komplexen Abfragen über mehrere Tabellen hinweg oder Transaktionen zur Parallelitätssteuerung – keine Fehler behoben werden können, wird auf Claude 3.5 Sonnet gewechselt.

Die Verbindungsmethode zur Vermeidung von Kontextverschwendung zwischen den beiden Modellen sieht wie folgt aus:

  • Aus den mit Gemini 2.0 Flash generierten UI-Komponenten den gesamten Code entfernen und nur die TypeScript-Interfaces (Props und States) extrahieren.
  • Ein leichtgewichtigenes JSON-Schema erstellen, das HTTP-Methoden, URL-Pfade sowie Anfrage- und Antwort-Bodys enthält, um es an das Backend zu übergeben.
  • Ausschließlich dieses Schema an DeepSeek V3 übergeben, um den Backend-API-Endpunkt zu implementieren. Dadurch lassen sich pro Sitzung 15.000 Token einsparen und die gesamte Entwicklungszeit um etwa 5 Stunden verkürzen.

4. Blockierung autonomer Korrekturschleifen und Kriterien für die Praxisprüfung

Da öffentliche Benchmarks anhand von einmaligen Abfragen gemessen werden, unterscheiden sie sich von Umgebungen mit Coding-Agenten (wie Aider). Wenn ein Gespräch mehr als 10 Turns andauert, wird der bisherige Gesprächsverlauf jedes Mal mitgesendet, sodass allein für die Korrektur eines Tippfehlers 1 bis 2 $ anfallen.

Gerät der Agent in eine autonome Korrekturschleife, in der er nach einem Testfehler den Code selbstständig korrigiert und erneut ausführt, schmelzen innerhalb weniger Minuten 20 bis 50 $ dahin. Um dies zu verhindern, sollten drei Kontrollkriterien eingerichtet werden:

  • In den Agenten-Ausführungsoptionen die maximale Anzahl autonomer Wiederholungen ohne menschliches Eingreifen (Max Iterations) auf 3 bis 5 begrenzen.
  • Nicht das gesamte Fehlerprotokoll übergeben, sondern nur die Kernbotschaft der obersten 20 Zeilen ausschneiden und einfügen.
  • Sobald sich Korrekturen an derselben Dateiposition dreimal oder öfter wiederholen, den Prozess sofort gewaltsam beenden und den Code selbst überprüfen.
Prüfpunkt Details zur Überprüfung Ausführungs- und Prüfmethode
Prompt-Isolierung Überprüfung von Ignorier-Dateien und Packungsgröße Vorabmessung der gepackten Token nach Anwendung von .gitignore und repomix.config.json
Modellverteilung Zuweisung von Modellen nach Arbeitsschwierigkeit UI für Gemini Flash, CRUD für DeepSeek V3, anspruchsvolle Logik für Claude Sonnet zuweisen
Prompt Caching Überprüfung von Mindest-Token-Einheiten und Breakpoints Nachweis von über 1.024 Token im System-Prompt und Einfügen von cache_control
Obergrenzen & Schleifen-Limits Einrichtung von Sicherheits-Stopps Begrenzung autonomer Agenten-Wiederholungen auf maximal 5, Festlegung von Ausgabenlimits in der API-Provider-Konsole

Das Wichtigste beim Einsatz von Coding-KI ist nicht, blindlings das neueste und teuerste Modell einzubinden, sondern die Werkzeuge an die Besonderheiten der jeweiligen Aufgabe anzupassen. Durch das Abschätzen des Budgets mittels Token-Formeln, das Ausmisten von Prompts mit Repomix und das gezielte Mischen von Modellen entsprechend dem Aufgabenprofil lässt sich ein Produkt ohne finanzielle Belastung fertigstellen.