Schneller entwickeln. Code bleibt im Haus.
OpenCode mit offenen Modellen. Senior-Review systematisch, nicht als Engpass.
Entwicklung mit Künstlicher Intelligenz (KI) für Spryker- und B2B-Plattform-Teams. OpenCode als modell-unabhängiger Entwicklungs-Agent, offene Modelle (Llama, Mistral) auf eigener GPU-Hardware oder bei DACH-Hostern. Code-Karte des Repos, Review-Agenten, Steuerungs-Hooks ab Tag eins. Senior-Review wird zum festen Ablauf, kein Engpass — und kein Code-Versand in die US-Cloud.
Drei Sovereignty-Anker.
Alle on-prem-fähig.
Cursor setzt US-Cloud für Premium-Features voraus. GitHub Copilot läuft auf Microsoft-Cloud ohne Air-Gap-Option. Wer Code-Sovereignty braucht — und das sind in DACH-Industrie deutlich mehr als vor drei Jahren — braucht einen anderen Stack.
OpenCode (sst/opencode) ist ein terminal-basierter Engineering-Agent, der über eine OpenAI-kompatible API mit beliebigen Backends spricht: Ollama lokal, vLLM im Cluster, Anthropic, OpenAI oder Google Vertex als Cloud-Option. Self-Host bedeutet vollständig egress-freier Betrieb. Cursor und GitHub Copilot haben keinen vergleichbaren Air-Gap-Modus — das ist der strukturelle Unterschied für Unternehmen mit Code-Sovereignty-Anforderung.
Quelle: sst/opencode GitHub · OpenAI-compatible API specLlama 3.3 70B Instruct (Meta, Dezember 2024) erreicht Performance nahe Llama 3.1 405B bei einem Sechstel des Compute-Bedarfs. Int4-quantisiert läuft es auf einer einzelnen H100 80GB mit 30–80 Tokens/s im Single-User-Betrieb. Mixtral 8x22B (Apache 2.0) ist vollständig kommerziell ohne Sondervereinbarung — kein Lizenz-Overhead bei internem Einsatz. DACH-GPU-Hoster: AD IT Systems, IONOS AI Model Hub, Hetzner GPU, Open Telekom Cloud, StackIT.
Quelle: Meta Llama 3.3 70B Instruct (12/2024) · Mixtral 8x22B Apache 2.0 (Mistral AI)Cloud-Frontier-APIs kosten derzeit 2–3 USD pro Million Input-Token bei Anthropic und OpenAI. Ab ~50–150 M Token/Monat amortisiert sich On-Prem-Hardware gegenüber Cloud-API-Kosten — je nach GPU-Leasing-Modell und Team-Größe. Darunter kann Cloud-Egress mit DLP-Schicht wirtschaftlich sinnvoll bleiben. Sovereignty ist dann immer noch möglich — über DLP-Egress-Filter, nicht über Hardware.
Quelle: Anthropic + OpenAI Pricing API (Q1 2025) · On-Prem-GPU-Kalkulation H100/A100 DACH
Modell-agnostisch.
Codebase-spezifisch.
Alle vier Bausteine sind modell-agnostisch: sie funktionieren mit Llama, Mistral, Anthropic oder OpenAI. Was sie codebase-spezifisch macht, sind eure Konventionen, eure Referenz-Dokumente, eure Entscheidungen.
Skills
Kodifizierte Workflows als ausführbare Anweisungs-Sets: welche Schritte in welcher Reihenfolge, welche Konventionen gelten, welche Anti-Pattern vermieden werden. Skills sind Markdown-Dateien — versionierbar, reviewbar, modell-agnostisch. Wer Konventions-Drift bekämpfen will, braucht dokumentierte Skills, nicht nur ein besseres Modell.
Workflows
Workflow-Contract Research-Plan-Execute entspricht dem ReAct-Pattern aus der ML-Literatur — explizit dokumentiert und für jeden Engineer nachvollziehbar. Phasen-Trennung verhindert, dass ein Agent halluziniert statt recherchiert. Subagent-Patterns für parallele Tasks sind Teil der Architektur, nicht der Vendor-Feature-Liste.
Memory
Persistenz über Sessions: Architektur-Entscheidungen, bekannte Anti-Pattern, Codebase-spezifische Konventionen als Referenz-Dokumente. Der Agent erinnert sich an relevante Fakten ohne jedes Mal von vorne zu starten. Memory-Dateien sind lokal — keine externe Vektor-Datenbank als Default, kein Egress für Kontext-Daten.
DLP-Egress
Microsoft Presidio (MIT-lizenziert): Regex + spaCy-NER prüft jeden Prompt und Output vor dem Cloud-Versand. Kunden-IDs, interne Endpoints, Credentials — maskiert oder geblockt, bevor sie das Netz verlassen. Presidio läuft lokal als Middleware, kein externer Service, kein Egress für die DLP-Prüfung selbst.
Drei Pattern, die Engineering-Teams bremsen.
Drei Situationen aus aktiven Mandaten — was Engineering-Teams davon abhält, AI-gestützte Workflows produktiv einzusetzen.
-
Pattern 01 · Code-Versand-Blocker
Legal blockt Cursor und Copilot. Kein Pilot läuft an.
Cursor setzt US-Cloud für Premium-Features voraus; GitHub Copilot läuft auf Microsoft-Cloud ohne Air-Gap. KRITIS-Betreiber, Rüstungszulieferer, Unternehmen mit US-Kundendaten-Pflichten können diese Tools nicht produktiv einsetzen, weil Code und Kontext an externe Server übermittelt wird. OpenCode + On-Prem-Inferenz ist die direkte Antwort: gleiche Workflow-Qualität, kein Egress als Default.
- Folge
- Engineering-Team arbeitet ohne AI-Unterstützung, Wettbewerbsnachteil wächst
- Frame-Reset
- OpenCode Self-Host + Open-Weights: volle Funktionalität, kein Cloud-Zwang
-
Pattern 02 · Convention-Drift
Der Agent kennt eure Architektur nicht und erfindet seine eigene.
Generische Coding-Assistenten generieren Code, der syntaktisch korrekt aber konventions-fremd ist — falsche Namespaces, ignorierte Abstraktions-Schichten, nicht-existente Patterns. Das erzeugt Review-Mehraufwand, der die Zeitersparnis aufhebt. Skill-Architektur dokumentiert eure Konventionen als ausführbare Referenz, die der Agent bei jeder Aufgabe liest. Drift wird messbar, nicht nur spürbar.
- Folge
- Review-Overhead frisst Produktivitätsgewinn
- Frame-Reset
- Codebase-spezifische Skills als Konventions-Anker für jeden Agent-Aufruf
-
Pattern 03 · Senior-Bottleneck
Alle komplexen Aufgaben hängen an ein oder zwei Seniors.
Architektur-Entscheidungen, komplexe Refactorings, Debugging in Legacy-Bereichen — diese Aufgaben landen immer bei denselben Personen. Skill-Architektur kodifiziert Senior-Wissen als ausführbare Workflows: Research-Phase klärt den Kontext, Plan-Phase skizziert die Lösung, Execute-Phase implementiert nach Konvention. Jüngere Teammitglieder können komplexere Aufgaben tragen, Seniors reviewen statt implementieren.
- Folge
- Wissens-Silo, Skalierungsdecke, Burn-out-Risiko bei Schlüsselpersonen
- Frame-Reset
- Explizite Workflows als portables Senior-Wissen im Team
Ein Engineering-Agent ist so gut wie die Konventionen, die ihr ihm mitgebt. Ohne Skill-Architektur ist er ein teures Autocomplete. Mit ihr wird er zum Multiplikator.
Fünf Fragen, fünf ehrliche Antworten.
- „Wir dürfen keinen Code an externe Provider schicken. Was ist unsere Option?"
- OpenCode + On-Prem-Inferenz (Ollama oder vLLM mit Llama 3.3 70B oder Mixtral 8x22B). Code und Kontext verlassen euer Netz nicht. Alternativ: DLP-Egress via Microsoft Presidio als Middleware vor Cloud-API-Aufruf — sensitives Material wird maskiert oder geblockt, bevor es versendet wird.
- „Was ist der Unterschied zwischen einem Skill und einem Prompt?"
- Ein Prompt ist einmalig. Ein Skill ist eine versionierte, codebase-spezifische Workflow-Beschreibung: Phasen, Konventionen, Anti-Pattern, Referenz-Dokumente. Der Agent liest den Skill bei jeder Ausführung — wie ein Engineer, der das Onboarding-Dokument kennt. Portabel über Modelle, auditierbar, erweiterbar.
- „Wie lange dauert es, bis das Pilot-Team produktiv ist?"
- Phase 1 ist abgegrenzt: Codebase-Skill-Map, OpenCode-Setup mit lokalem Modell, erste produktive Skills im Pilot-Team. Konditionen mandatsspezifisch. Keine Wochen-Versprechen hier — Tiefe und Komplexität eures Codebases bestimmen den Aufwand.
- „Rechnet sich On-Prem-Hardware für uns?"
- Break-Even liegt bei ~50–150 M Token/Monat gegenüber Cloud-Frontier-APIs (2–3 USD/M Input-Token). Darunter kann Cloud-Egress mit DLP-Schicht wirtschaftlicher sein. DACH-GPU-Hoster (AD IT Systems, IONOS, Hetzner, StackIT) sind oft günstiger als US-Cloud bei vergleichbarer GPU-Kapazität. Wir rechnen das konkret durch, wenn wir euren Use-Case kennen.
- „Können wir später auf ein anderes Modell wechseln?"
- Ja. Skill-Architektur und Workflows sind modell-agnostisch. Modell-Wechsel ist Konfigurations-Aufgabe, keine Re-Implementation. Wer heute Llama 3.3 70B einsetzt und morgen auf ein besseres Open-Weights-Modell wechselt, behält alle Skills unverändert.
Werkbank, Schleifen, Übergabe. Drei Prinzipien.
Wir bauen mit euch, nicht für euch. Mandate sind Werkbank, nicht Theater. Lieferung in kurzen Schleifen. Saubere Übergabe, danach trägt eure Mannschaft allein.
Methode im DetailTiefe Plattform-Expertise.
25 Jahre IT, davon 14 Jahre in B2B-Commerce. Architektur-Mandate bei Großkonzernen, Aufbau und Steuerung verteilter Expertenteams, vendor-neutrale Projektrettung. Schwerpunkte: Plattform-Architektur, Projektrettung, Team-Operations.
Chris Zepernick
Code-Sovereignty ist keine Ausnahme — sie ist der Ausgangspunkt.
Wer Engineering-AI ohne Egress-Konzept aufsetzt, baut eine Abhängigkeit ein, die Legal später aufbrechen muss. OpenCode, Open-Weights und DLP-Egress sind keine akademische Übung — sie sind die Architektur-Wahl, die Sovereignty von Tag 1 einbaut, ohne Cloud-Optionen dauerhaft zu sperren. Das Modell ist konfigurierbar. Die Architektur-Entscheidung nicht.
So arbeiten wirCoding-Agent ohne Cloud-Zwang — passt das zu eurem Setup?
Code-Sovereignty-Blocker, Convention-Drift oder Senior-Bottleneck: ein paar Minuten am Telefon und wir klären, welcher Hebel bei euch zuerst zieht.