KI-Safety-Review: Stand + Plan (2026-09-02)

# KI-Safety-Review: Experiment-Stand (2026-09-02, Weiterarbeit Montag)

## Setup (alles fertig)
- **Verzeichnis:** `~/Development/ai-safety-review/` (bewusst KEIN git) — corpus/, prompts/, results/, Skripte
- **Corpus:** `~/Development/joyson-safety-projects` (privat, nur moria-Remote). Extrahiert: `corpus/extracted/` (JTAG+UDS je TARA/CS-Concept/DOORS, UDS-design.md aus EA-XMI geparst: Lifelines+Messages, PUML), `corpus/pairs/` (16 Layer-Paare DOORS_JTAG/UDS). Nur `.eapx` (Access-DB) nicht geparst — mdbtools nötig falls gebraucht
- **Runner:** `run-review.sh <modell> <doc> [prompt] [ctx]` → Ollama-API, temp 0.2, think off, GPU-Meta im Output. Matrix-Skripte: `run-matrix-jtag.sh`, `run-matrix-uds.sh`, `run-pairs.sh`
- **Prompts:** tara-quality, cs-concept-quality, requirements-quality, traceability-review, **pairwise-review** (erzwingt ID-für-ID + Deckungsquote)
- **Scorer:** `score-matrix.py` → Format 3/3, Fundtiefe, ID-Faktizität, fabrizierte IDs → `results/score-matrix.json`. Achtung: zählt `###`, `Befund-ID:`, `**Befund N:**`, `[B001,`-Formate; SELF_ID_RE filtert Befund-001/TARA_001-Eigennumerierung

## Ergebnisse (83 Läufe)
- **Hauptbefund: klein+fokussiert schlägt groß.** Paare (ctx 16384): ~100 % ID-Faktizität. DOORS_UDS komplett ctx 32768: Format-Bruch aller Modelle (0/3). ctx **65536 Kontrolllauf: 50 % Faktizität (10 fabrizierte IDs)** — Kontext-Erhöhung gestorben, Slicing ist die Methode
- **qwen3-coder:30b = Referenz**, aber auf großen UDS-Docs wackelig (je 5 fabrizierte IDs bei CS-Concept_UDS + combined-uds; bei Paaren/JTAG: fehlerfrei)
- **qwen2.5-coder:14b = bester Review-Assistent im 14b-Tier**: 0–1 fabrizierte IDs überall, aber inhaltlich oberflächlich/affirmativ
- **glm4:9b:** TARA_UDS war sein bester Lauf (10 Befunde, 100 %, 3/3); schwach bei CS-Concept/Traceability
- **phi4:14b:** fabriziert bei CS-Concept (5 IDs), macht bei Traceability statt Review eine Matrix-Anleitung mit Corpus-Dump (Task-Failure)
- **deepseek-r1:14b:** Halluzinationen (33–60 % Faktizität); **olmo2:13b:** Instruction-Following zu schwach — beide für Review ungeeignet
- **Traceability-Ganzdokument-Task bricht fast alle** → nur noch als Paare fahren
- Ground-Truth TARA_JTAG (von mir verifiziert): CAL-Inkonsistenz THRT_1/3 (Low/CAL2) vs THRT_2 (Medium/CAL1); ~45 Junk-Zeilen mit #N/A + „Retaining"; THRT_10=Duplikat von THRT_1 mit UDS-Rationale („unauthentic messages") statt JTAG; DSCE_2 ohne Rationales; CG-01-Typo „unaothorized". qwen30b fand ~70 % davon, Junk-Zeilen nur diffus
- Pair-Fund-Beispiel (30b, sys-sw): SYS-RQ-023 ohne SW-Umsetzung, SWRQ-026 dangling, SYS-RQ-017/018/019 mit fehlenden OEM-Refs, Deckung 23/26 (88,5 %) — **Jan-Gegencheck offen**

## Plan (abgestimmt)
1. **Montag:** Jan-Gegenprobe Pair-Funde (echter Fund/FP/Halluzination) → Fundtiefe-Spalte in Score-Matrix; Deckungsquoten pro Layer-Paar aggregieren; finaler infra#2-Kommentar (nur Aggregate, keine Zitate)
2. **Prompts härten:** pairwise als Standard; traceability nur noch paarweise; DOORS_UDS ggf. sheetweise
3. **API-Runde (kw 37):** Corpus ZUERST anonymisieren (OEM/Projekt-ID/Personen), dann OpenRouter-Screening Kimi K2/K3, DeepSeek V3.2/R1, GLM-4.6, Llama-405B — ~$0,03/Review mit Pair-Format, < $1 gesamt. Kein Corpus ins Cloud ohne Anonymisierung (B0)
4. **falls gut:** dauerhaft Mietlösung — dedicated H200 (~3–4 $/h) NUR bei DPA-fähigen Anbietern EU-Region für echte Kundendaten; Marketplace-Spot ist TISAX/NDA-untauglich

## Embedding-Idee (Bewertung)
- **Als Kontext-Ersatz: nein** — Corpus ist klein, Paar-Slicing ist optimal; RAG lohnt erst bei großen echten Corpora
- **Als Fund-Erzeuger: ja, 2 konkrete use cases:** (a) Near-Duplicate/Contradiction-Erkennung in DOORS-Requirements (semantische Cluster), (b) Trace-Link-Vorschläge TARA↔DOORS↔CS-Concept — findet *fehlende* Links, die ID-Checks prinzipiell nicht finden können. qwen3-embedding (4,7G, installiert) als Modell. Embeddings = Finder, deterministische ID-Checks + LLM-Paare = Verifizierer

id: 15862cf21e014917adfd12f7e6fd4f19
parent_id: 86f1e0f3538341dfaa58cc3357e03343
created_time: 2026-09-02T17:47:53.047Z
updated_time: 2026-09-02T17:47:53.047Z
is_conflict: 0
latitude: 0.00000000
longitude: 0.00000000
altitude: 0.0000
author: 
source_url: 
is_todo: 0
todo_due: 0
todo_completed: 0
source: joplin-desktop
source_application: net.cozic.joplin-desktop
application_data: 
order: 1788371273047
user_created_time: 2026-09-02T17:47:53.047Z
user_updated_time: 2026-09-02T17:47:53.047Z
encryption_cipher_text: 
encryption_applied: 0
markup_language: 1
is_shared: 0
share_id: 
conflict_original_id: 
master_key_id: 
user_data: 
deleted_time: 0
is_locked: 0
extracted_resource_ids: 
type_: 1