KI im Engineering · OpenCode · Skills · Steuerung

Schneller entwickeln. Code bleibt im Haus.

OpenCode mit offenen Modellen. Senior-Review systematisch, nicht als Engpass.

Entwicklung mit Künstlicher Intelligenz (KI) für Spryker- und B2B-Plattform-Teams. OpenCode als modell-unabhängiger Entwicklungs-Agent, offene Modelle (Llama, Mistral) auf eigener GPU-Hardware oder bei DACH-Hostern. Code-Karte des Repos, Review-Agenten, Steuerungs-Hooks ab Tag eins. Senior-Review wird zum festen Ablauf, kein Engpass — und kein Code-Versand in die US-Cloud.

Engineering-Stack

Drei Sovereignty-Anker.
Alle on-prem-fähig.

Cursor setzt US-Cloud für Premium-Features voraus. GitHub Copilot läuft auf Microsoft-Cloud ohne Air-Gap-Option. Wer Code-Sovereignty braucht — und das sind in DACH-Industrie deutlich mehr als vor drei Jahren — braucht einen anderen Stack.

OpenCode Terminal-Agent · Self-Host · OpenAI-kompatible API

OpenCode (sst/opencode) ist ein terminal-basierter Engineering-Agent, der über eine OpenAI-kompatible API mit beliebigen Backends spricht: Ollama lokal, vLLM im Cluster, Anthropic, OpenAI oder Google Vertex als Cloud-Option. Self-Host bedeutet vollständig egress-freier Betrieb. Cursor und GitHub Copilot haben keinen vergleichbaren Air-Gap-Modus — das ist der strukturelle Unterschied für Unternehmen mit Code-Sovereignty-Anforderung.

Quelle: sst/opencode GitHub · OpenAI-compatible API spec
Llama 3.3 70B int4 1× H100 80GB · 30–80 Tokens/s Single-User

Llama 3.3 70B Instruct (Meta, Dezember 2024) erreicht Performance nahe Llama 3.1 405B bei einem Sechstel des Compute-Bedarfs. Int4-quantisiert läuft es auf einer einzelnen H100 80GB mit 30–80 Tokens/s im Single-User-Betrieb. Mixtral 8x22B (Apache 2.0) ist vollständig kommerziell ohne Sondervereinbarung — kein Lizenz-Overhead bei internem Einsatz. DACH-GPU-Hoster: AD IT Systems, IONOS AI Model Hub, Hetzner GPU, Open Telekom Cloud, StackIT.

Quelle: Meta Llama 3.3 70B Instruct (12/2024) · Mixtral 8x22B Apache 2.0 (Mistral AI)
~50–150 M Token/Monat Hardware-Break-Even vs. Cloud-API

Cloud-Frontier-APIs kosten derzeit 2–3 USD pro Million Input-Token bei Anthropic und OpenAI. Ab ~50–150 M Token/Monat amortisiert sich On-Prem-Hardware gegenüber Cloud-API-Kosten — je nach GPU-Leasing-Modell und Team-Größe. Darunter kann Cloud-Egress mit DLP-Schicht wirtschaftlich sinnvoll bleiben. Sovereignty ist dann immer noch möglich — über DLP-Egress-Filter, nicht über Hardware.

Quelle: Anthropic + OpenAI Pricing API (Q1 2025) · On-Prem-GPU-Kalkulation H100/A100 DACH
Vier Bausteine

Modell-agnostisch.
Codebase-spezifisch.

Alle vier Bausteine sind modell-agnostisch: sie funktionieren mit Llama, Mistral, Anthropic oder OpenAI. Was sie codebase-spezifisch macht, sind eure Konventionen, eure Referenz-Dokumente, eure Entscheidungen.

01

Skills

Kodifizierte Workflows als ausführbare Anweisungs-Sets: welche Schritte in welcher Reihenfolge, welche Konventionen gelten, welche Anti-Pattern vermieden werden. Skills sind Markdown-Dateien — versionierbar, reviewbar, modell-agnostisch. Wer Konventions-Drift bekämpfen will, braucht dokumentierte Skills, nicht nur ein besseres Modell.

02

Workflows

Workflow-Contract Research-Plan-Execute entspricht dem ReAct-Pattern aus der ML-Literatur — explizit dokumentiert und für jeden Engineer nachvollziehbar. Phasen-Trennung verhindert, dass ein Agent halluziniert statt recherchiert. Subagent-Patterns für parallele Tasks sind Teil der Architektur, nicht der Vendor-Feature-Liste.

03

Memory

Persistenz über Sessions: Architektur-Entscheidungen, bekannte Anti-Pattern, Codebase-spezifische Konventionen als Referenz-Dokumente. Der Agent erinnert sich an relevante Fakten ohne jedes Mal von vorne zu starten. Memory-Dateien sind lokal — keine externe Vektor-Datenbank als Default, kein Egress für Kontext-Daten.

04

DLP-Egress

Microsoft Presidio (MIT-lizenziert): Regex + spaCy-NER prüft jeden Prompt und Output vor dem Cloud-Versand. Kunden-IDs, interne Endpoints, Credentials — maskiert oder geblockt, bevor sie das Netz verlassen. Presidio läuft lokal als Middleware, kein externer Service, kein Egress für die DLP-Prüfung selbst.

Engineering in der Praxis

Drei Pattern, die Engineering-Teams bremsen.

Drei Situationen aus aktiven Mandaten — was Engineering-Teams davon abhält, AI-gestützte Workflows produktiv einzusetzen.

  1. Pattern 01 · Code-Versand-Blocker

    Legal blockt Cursor und Copilot. Kein Pilot läuft an.

    Cursor setzt US-Cloud für Premium-Features voraus; GitHub Copilot läuft auf Microsoft-Cloud ohne Air-Gap. KRITIS-Betreiber, Rüstungszulieferer, Unternehmen mit US-Kundendaten-Pflichten können diese Tools nicht produktiv einsetzen, weil Code und Kontext an externe Server übermittelt wird. OpenCode + On-Prem-Inferenz ist die direkte Antwort: gleiche Workflow-Qualität, kein Egress als Default.

    Folge
    Engineering-Team arbeitet ohne AI-Unterstützung, Wettbewerbsnachteil wächst
    Frame-Reset
    OpenCode Self-Host + Open-Weights: volle Funktionalität, kein Cloud-Zwang
  2. Pattern 02 · Convention-Drift

    Der Agent kennt eure Architektur nicht und erfindet seine eigene.

    Generische Coding-Assistenten generieren Code, der syntaktisch korrekt aber konventions-fremd ist — falsche Namespaces, ignorierte Abstraktions-Schichten, nicht-existente Patterns. Das erzeugt Review-Mehraufwand, der die Zeitersparnis aufhebt. Skill-Architektur dokumentiert eure Konventionen als ausführbare Referenz, die der Agent bei jeder Aufgabe liest. Drift wird messbar, nicht nur spürbar.

    Folge
    Review-Overhead frisst Produktivitätsgewinn
    Frame-Reset
    Codebase-spezifische Skills als Konventions-Anker für jeden Agent-Aufruf
  3. Pattern 03 · Senior-Bottleneck

    Alle komplexen Aufgaben hängen an ein oder zwei Seniors.

    Architektur-Entscheidungen, komplexe Refactorings, Debugging in Legacy-Bereichen — diese Aufgaben landen immer bei denselben Personen. Skill-Architektur kodifiziert Senior-Wissen als ausführbare Workflows: Research-Phase klärt den Kontext, Plan-Phase skizziert die Lösung, Execute-Phase implementiert nach Konvention. Jüngere Teammitglieder können komplexere Aufgaben tragen, Seniors reviewen statt implementieren.

    Folge
    Wissens-Silo, Skalierungsdecke, Burn-out-Risiko bei Schlüsselpersonen
    Frame-Reset
    Explizite Workflows als portables Senior-Wissen im Team

Ein Engineering-Agent ist so gut wie die Konventionen, die ihr ihm mitgebt. Ohne Skill-Architektur ist er ein teures Autocomplete. Mit ihr wird er zum Multiplikator.

Bevor ihr anruft

Fünf Fragen, fünf ehrliche Antworten.

„Wir dürfen keinen Code an externe Provider schicken. Was ist unsere Option?"
OpenCode + On-Prem-Inferenz (Ollama oder vLLM mit Llama 3.3 70B oder Mixtral 8x22B). Code und Kontext verlassen euer Netz nicht. Alternativ: DLP-Egress via Microsoft Presidio als Middleware vor Cloud-API-Aufruf — sensitives Material wird maskiert oder geblockt, bevor es versendet wird.
„Was ist der Unterschied zwischen einem Skill und einem Prompt?"
Ein Prompt ist einmalig. Ein Skill ist eine versionierte, codebase-spezifische Workflow-Beschreibung: Phasen, Konventionen, Anti-Pattern, Referenz-Dokumente. Der Agent liest den Skill bei jeder Ausführung — wie ein Engineer, der das Onboarding-Dokument kennt. Portabel über Modelle, auditierbar, erweiterbar.
„Wie lange dauert es, bis das Pilot-Team produktiv ist?"
Phase 1 ist abgegrenzt: Codebase-Skill-Map, OpenCode-Setup mit lokalem Modell, erste produktive Skills im Pilot-Team. Konditionen mandatsspezifisch. Keine Wochen-Versprechen hier — Tiefe und Komplexität eures Codebases bestimmen den Aufwand.
„Rechnet sich On-Prem-Hardware für uns?"
Break-Even liegt bei ~50–150 M Token/Monat gegenüber Cloud-Frontier-APIs (2–3 USD/M Input-Token). Darunter kann Cloud-Egress mit DLP-Schicht wirtschaftlicher sein. DACH-GPU-Hoster (AD IT Systems, IONOS, Hetzner, StackIT) sind oft günstiger als US-Cloud bei vergleichbarer GPU-Kapazität. Wir rechnen das konkret durch, wenn wir euren Use-Case kennen.
„Können wir später auf ein anderes Modell wechseln?"
Ja. Skill-Architektur und Workflows sind modell-agnostisch. Modell-Wechsel ist Konfigurations-Aufgabe, keine Re-Implementation. Wer heute Llama 3.3 70B einsetzt und morgen auf ein besseres Open-Weights-Modell wechselt, behält alle Skills unverändert.
Erfahrung & Kontakt

Tiefe Plattform-Expertise.

25 Jahre IT, davon 14 Jahre in B2B-Commerce. Architektur-Mandate bei Großkonzernen, Aufbau und Steuerung verteilter Expertenteams, vendor-neutrale Projektrettung. Schwerpunkte: Plattform-Architektur, Projektrettung, Team-Operations.

Chris Zepernick

Senior Berater · Hamburg

Was wir gelernt haben

Code-Sovereignty ist keine Ausnahme — sie ist der Ausgangspunkt.

Wer Engineering-AI ohne Egress-Konzept aufsetzt, baut eine Abhängigkeit ein, die Legal später aufbrechen muss. OpenCode, Open-Weights und DLP-Egress sind keine akademische Übung — sie sind die Architektur-Wahl, die Sovereignty von Tag 1 einbaut, ohne Cloud-Optionen dauerhaft zu sperren. Das Modell ist konfigurierbar. Die Architektur-Entscheidung nicht.

So arbeiten wir

Coding-Agent ohne Cloud-Zwang — passt das zu eurem Setup?

Code-Sovereignty-Blocker, Convention-Drift oder Senior-Bottleneck: ein paar Minuten am Telefon und wir klären, welcher Hebel bei euch zuerst zieht.