Pillar 1 · Q4 2026 · Beta in Vorbereitung
Public LLM Core
compliance-qwen
Das erste öffentlich reproduzierbare, EU-gehostete AI-Governance-Sprachmodell. Kein Blackbox-Training — jeder Schritt vom Korpus bis zum fertigen Modell ist offen dokumentiert und nachvollziehbar.
Modell-Spezifikation
| Parameter | Wert |
|---|---|
| Basis-Modell | Qwen/Qwen2.5-7B-Instruct (Apache-2.0) |
| Methode | QLoRA (4-bit NF4, rank=64, alpha=128) |
| Trainingsdaten | OCC-Korpus, ~689 Chunks aus 26 verifizierten Public-Domain-Quellen |
| Ziel-Aufgabe | AI-Governance Q&A (EU AI Act, ISO 42001, DSGVO, NIST AI RMF) |
| Sprachen | Deutsch primär, Englisch sekundär |
| Compute | IIO AI Hub — RTX PRO 6000 (96GB VRAM) |
| Geschätzte Trainingsdauer | 2-4 Stunden (1 Epoche) |
| Distribution | Hugging Face Hub + IIO AI Hub |
3-Phasen-Pipeline
- Phase 1 — Datenaufbereitung: OCC-Chunks → Instruction-Following-Format (Alpaca), Qualitätsfilter (50-800 Tokens/Paar)
- Phase 2 — Training: QLoRA-Finetuning auf IIO AI Hub, reproduzierbares Rezept vollständig dokumentiert
- Phase 3 — Eval-Gate: Läuft durch das Eval & Safety Lab (Pillar 3) — Pflicht-Grade B+ (Pass-Rate ≥ 0,65) vor jeder Freigabe, kein Release ohne Safety-Signoff
Status & Trainingsbereitschaft
Trainingsdaten: 241 Instruction-Pairs (Alpaca-Format), 0 Parse-Fehler, 0 PII-Funde
Basis-Modell: verifügbar, lizenzgeklärt (Apache-2.0)
Offen: HITL-Gate model-training (P3, Human Review), Cost-Guard-GO für GPU-Compute
Erwartetes Trainingsfenster: Q4 2026