Zum Inhalt springen
Q
Pharma QRM
Prüfmappe vorbereiten
PrüffälleRegelwerkRingversuchFunktionsweiseKalibrierung

Was das System findet — und was nicht. Gemessen.

Ein Ringversuch prüft das Tool wie ein Labor: mit präparierten Fällen, deren Fehler vorab dokumentiert und versiegelt sind. Erst nach dem Lauf wird der Umschlag geöffnet und verglichen. Hier steht das Ergebnis — vollständig, auch die Fälle, die das System verfehlt hat.

So läuft der Ringversuch.

Was hier gemessen wird.

Zehn realistische GMP-Fälle werden präpariert: Change-, Abweichungs- und CAPA-Unterlagen, in die bewusst Fehler eingebaut sind — eine Klassifizierung, die die Daten nicht hergeben, ein fehlender Pflichtnachweis, ein Zitat, das im Original anders steht. Jeder eingebaute Fehler wird vorab dokumentiert und versiegelt. Dazu kommen harmlose Kontrollstellen ohne jeden Fehler.

Das System sieht die Fälle zum ersten Mal im Lauf. Danach wird verglichen: Welche eingebauten Fehler hat es gefunden? Welche übersehen? Und ist es bei den harmlosen Kontrollstellen ruhig geblieben — oder hat es Fehler gemeldet, wo keine waren?

Ausgewählter Lauf · 23.08.2026, 18:59 Uhr

System-Aufbau: Zwei-Anbieter-Stack (Claude + GPT) · Anforderungsweg · pro Anforderung. Korpus: Blindkorpus 3, 8 Fälle, beim Bau der Engine nie gesehen.

Eingebaute Fehler
14 von 16
eingebauten Fehlern gefunden

Die Trefferquote zeigt, wie viel das System aufdeckt. Verfehlte Fälle: 2.

Fehlalarme
0
Fehlalarme bei 16 harmlosen Kontrollstellen

Null Fehlalarme heißt: Das System produziert keine Arbeit, wo keine nötig ist. Das ist so wichtig wie die Trefferquote.

Belegte Befunde
97 %
der Befunde mit wörtlich geprüftem Zitat

Jeder belegte Befund verweist auf eine Stelle, die maschinell gegen das Original geprüft wurde.

Jeder Fall einzeln — auch der verfehlte.

Für diesen Lauf ist die fallbezogene Matrix nicht öffentlich ausgeliefert. Die Zusammenfassung oben bleibt sichtbar; die Detaildaten liegen im internen Qualifizierungsnachweis.

Was dieser Nachweis zeigt — und was noch nicht.

Dieser Ringversuch läuft mit synthetischen Fällen. Er beweist, dass das System die eingebauten Fehlertypen zuverlässig findet und bei sauberen Unterlagen ruhig bleibt. Er beweist noch nicht, wie es sich mit Ihren echten Unterlagen und Ihrem Regelwerk verhält — dafür ist der nächste Schritt da: ein Blindtest mit Ihren eigenen Fällen, deren Lösung nur Sie kennen.

Die Streuung von KI ist kein Geheimnis, das hier versteckt wird. Der Ringversuch wird wiederholt; jeder Lauf ist mit Modell, Version und Prüfauftrag protokolliert und im Detail einsehbar. Was Sie oben sehen, ist beim ersten Laden der jüngste abgeschlossene Live-Lauf — nicht der beste ausgewählte.

Lauf-Historie

Jede Zeile ist ein Testdurchlauf. Beim ersten Laden ist der jüngste Live-Lauf ausgewählt; ältere Läufe können zum Vergleich geöffnet werden.

ZeitpunktSystem-AufbauGefundene FehlerKontrollstellen ruhigBelegte Befunde
24.08.2026, 07:20 UhrEU-Stack (nur Qwen auf Hetzner) · Anforderungsweg · pro AnforderungBlindkorpus 3, 8 Fälle, beim Bau der Engine nie gesehen14/16 (87,5 %)16/1683 %
23.08.2026, 18:59 UhrZwei-Anbieter-Stack (Claude + GPT) · Anforderungsweg · pro AnforderungBlindkorpus 3, 8 Fälle, beim Bau der Engine nie gesehen14/16 (87,5 %)16/1697 %
23.08.2026, 15:20 UhrZwei-Anbieter-Stack (Claude + GPT) · Anforderungsweg · gruppiertGoldstandard-Korpus, 10 Fälle, Regressionskorpus24/25 (96 %)11/1197 %
23.08.2026, 15:20 UhrEU-Stack (nur Qwen auf Hetzner) · Anforderungsweg · pro AnforderungGoldstandard-Korpus, 10 Fälle, Regressionskorpus23/25 (92 %)11/1193 %
23.08.2026, 11:23 UhrEU-Stack (nur Qwen auf Hetzner) · Anforderungsweg · pro AnforderungGoldstandard-Korpus, 10 Fälle, Regressionskorpus22/25 (88 %)11/1191 %
22.08.2026, 22:50 UhrEU-Stack (nur Qwen auf Hetzner) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus12/25 (48 %)11/1149 %
22.08.2026, 22:16 UhrZwei-Anbieter-Stack (Claude + GPT) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus22/25 (88 %)11/1157 %
22.08.2026, 20:58 UhrEU-Kaskade (Qwen liest, Claude prüft) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus7/25 (28 %)11/1122 %
22.08.2026, 20:43 UhrZwei-Anbieter-Stack (Claude + GPT) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus22/25 (88 %)11/1154 %
22.08.2026, 19:11 UhrEU-Stack (nur Qwen auf Hetzner) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus8/25 (32 %)11/1122 %
25.07.2026, 19:40 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus25/25 (100 %)11/1189 %
25.07.2026, 17:08 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus25/25 (100 %)11/1187 %
25.07.2026, 16:21 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus22/25 (88 %)11/1198 %
13.06.2026, 21:30 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus24/25 (96 %)11/1193 %
13.06.2026, 21:03 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus2/2 (100 %)1/1100 %
13.06.2026, 20:57 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus2/2 (100 %)1/179 %
13.06.2026, 20:22 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 3 Fälle, Regressionskorpus6/7 (85,7 %)3/398 %
13.06.2026, 12:07 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus25/25 (100 %)11/1191 %
13.06.2026, 11:43 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus3/3 (100 %)1/1100 %
11.06.2026, 06:07 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus24/25 (96 %)11/1193 %
10.06.2026, 20:34 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus2/2 (100 %)1/189 %
10.06.2026, 16:09 UhrHybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus23/25 (92 %)11/1197 %
10.06.2026, 13:40 UhrFrontier-Stack (Claude + GPT) — historischGoldstandard-Korpus, 4 Fälle, Regressionskorpus9/11 (81,8 %)4/485 %
10.06.2026, 13:39 UhrBaseline ohne KI (Regex)Goldstandard-Korpus, 1 Fälle, Regressionskorpus0/2 (0 %)1/1100 %
10.06.2026, 09:49 UhrEU-Stack (nur Mistral) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus23/25 (92 %)11/1189 %
10.06.2026, 09:00 UhrFrüher KI-Lauf — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus13/25 (52 %)11/1182 %
10.06.2026, 08:29 UhrFrüher KI-Lauf — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus2/2 (100 %)1/149 %
10.06.2026, 07:12 UhrFrüher KI-Lauf — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus15/25 (60 %)11/1186 %
10.06.2026, 07:09 UhrFrüher KI-Lauf — historischGoldstandard-Korpus, 3 Fälle, Regressionskorpus0/7 (0 %)4/4–
10.06.2026, 07:06 UhrFrüher KI-Lauf — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus2/2 (100 %)1/183 %
10.06.2026, 07:04 UhrFrüher KI-Lauf — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus0/25 (0 %)11/11–
10.06.2026, 07:02 UhrFrüher KI-Lauf — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus2/2 (100 %)1/183 %
10.06.2026, 06:59 UhrBaseline ohne KI (Regex)Goldstandard-Korpus, 10 Fälle, Regressionskorpus3/25 (12 %)11/11100 %