Zum Hauptinhalt springen
Pillar 1 · Q4 2026 · Beta in Vorbereitung

Public LLM Core
compliance-qwen

Das erste öffentlich reproduzierbare, EU-gehostete AI-Governance-Sprachmodell. Kein Blackbox-Training — jeder Schritt vom Korpus bis zum fertigen Modell ist offen dokumentiert und nachvollziehbar.

Modell-Spezifikation

ParameterWert
Basis-ModellQwen/Qwen2.5-7B-Instruct (Apache-2.0)
MethodeQLoRA (4-bit NF4, rank=64, alpha=128)
TrainingsdatenOCC-Korpus, ~689 Chunks aus 26 verifizierten Public-Domain-Quellen
Ziel-AufgabeAI-Governance Q&A (EU AI Act, ISO 42001, DSGVO, NIST AI RMF)
SprachenDeutsch primär, Englisch sekundär
ComputeIIO AI Hub — RTX PRO 6000 (96GB VRAM)
Geschätzte Trainingsdauer2-4 Stunden (1 Epoche)
DistributionHugging Face Hub + IIO AI Hub

3-Phasen-Pipeline

  • Phase 1 — Datenaufbereitung: OCC-Chunks → Instruction-Following-Format (Alpaca), Qualitätsfilter (50-800 Tokens/Paar)
  • Phase 2 — Training: QLoRA-Finetuning auf IIO AI Hub, reproduzierbares Rezept vollständig dokumentiert
  • Phase 3 — Eval-Gate: Läuft durch das Eval & Safety Lab (Pillar 3) — Pflicht-Grade B+ (Pass-Rate ≥ 0,65) vor jeder Freigabe, kein Release ohne Safety-Signoff

Status & Trainingsbereitschaft

Trainingsdaten: 241 Instruction-Pairs (Alpaca-Format), 0 Parse-Fehler, 0 PII-Funde

Basis-Modell: verifügbar, lizenzgeklärt (Apache-2.0)

Offen: HITL-Gate model-training (P3, Human Review), Cost-Guard-GO für GPU-Compute

Erwartetes Trainingsfenster: Q4 2026

Nächste Schritte