Ein Ringversuch prüft das Tool wie ein Labor: mit präparierten Fällen, deren Fehler vorab dokumentiert und versiegelt sind. Erst nach dem Lauf wird der Umschlag geöffnet und verglichen. Hier steht das Ergebnis — vollständig, auch die Fälle, die das System verfehlt hat.
Was hier gemessen wird.
Zehn realistische GMP-Fälle werden präpariert: Change-, Abweichungs- und CAPA-Unterlagen, in die bewusst Fehler eingebaut sind — eine Klassifizierung, die die Daten nicht hergeben, ein fehlender Pflichtnachweis, ein Zitat, das im Original anders steht. Jeder eingebaute Fehler wird vorab dokumentiert und versiegelt. Dazu kommen harmlose Kontrollstellen ohne jeden Fehler.
Das System sieht die Fälle zum ersten Mal im Lauf. Danach wird verglichen: Welche eingebauten Fehler hat es gefunden? Welche übersehen? Und ist es bei den harmlosen Kontrollstellen ruhig geblieben — oder hat es Fehler gemeldet, wo keine waren?
System-Aufbau: Zwei-Anbieter-Stack (Claude + GPT) · Anforderungsweg · pro Anforderung. Korpus: Blindkorpus 3, 8 Fälle, beim Bau der Engine nie gesehen.
Die Trefferquote zeigt, wie viel das System aufdeckt. Verfehlte Fälle: 2.
Null Fehlalarme heißt: Das System produziert keine Arbeit, wo keine nötig ist. Das ist so wichtig wie die Trefferquote.
Jeder belegte Befund verweist auf eine Stelle, die maschinell gegen das Original geprüft wurde.
Für diesen Lauf ist die fallbezogene Matrix nicht öffentlich ausgeliefert. Die Zusammenfassung oben bleibt sichtbar; die Detaildaten liegen im internen Qualifizierungsnachweis.
Dieser Ringversuch läuft mit synthetischen Fällen. Er beweist, dass das System die eingebauten Fehlertypen zuverlässig findet und bei sauberen Unterlagen ruhig bleibt. Er beweist noch nicht, wie es sich mit Ihren echten Unterlagen und Ihrem Regelwerk verhält — dafür ist der nächste Schritt da: ein Blindtest mit Ihren eigenen Fällen, deren Lösung nur Sie kennen.
Die Streuung von KI ist kein Geheimnis, das hier versteckt wird. Der Ringversuch wird wiederholt; jeder Lauf ist mit Modell, Version und Prüfauftrag protokolliert und im Detail einsehbar. Was Sie oben sehen, ist beim ersten Laden der jüngste abgeschlossene Live-Lauf — nicht der beste ausgewählte.
Jede Zeile ist ein Testdurchlauf. Beim ersten Laden ist der jüngste Live-Lauf ausgewählt; ältere Läufe können zum Vergleich geöffnet werden.
| Zeitpunkt | System-Aufbau | Gefundene Fehler | Kontrollstellen ruhig | Belegte Befunde |
|---|---|---|---|---|
| 24.08.2026, 07:20 Uhr | EU-Stack (nur Qwen auf Hetzner) · Anforderungsweg · pro AnforderungBlindkorpus 3, 8 Fälle, beim Bau der Engine nie gesehen | 14/16 (87,5 %) | 16/16 | 83 % |
| 23.08.2026, 18:59 Uhr | Zwei-Anbieter-Stack (Claude + GPT) · Anforderungsweg · pro AnforderungBlindkorpus 3, 8 Fälle, beim Bau der Engine nie gesehen | 14/16 (87,5 %) | 16/16 | 97 % |
| 23.08.2026, 15:20 Uhr | Zwei-Anbieter-Stack (Claude + GPT) · Anforderungsweg · gruppiertGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 24/25 (96 %) | 11/11 | 97 % |
| 23.08.2026, 15:20 Uhr | EU-Stack (nur Qwen auf Hetzner) · Anforderungsweg · pro AnforderungGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 23/25 (92 %) | 11/11 | 93 % |
| 23.08.2026, 11:23 Uhr | EU-Stack (nur Qwen auf Hetzner) · Anforderungsweg · pro AnforderungGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 22/25 (88 %) | 11/11 | 91 % |
| 22.08.2026, 22:50 Uhr | EU-Stack (nur Qwen auf Hetzner) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 12/25 (48 %) | 11/11 | 49 % |
| 22.08.2026, 22:16 Uhr | Zwei-Anbieter-Stack (Claude + GPT) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 22/25 (88 %) | 11/11 | 57 % |
| 22.08.2026, 20:58 Uhr | EU-Kaskade (Qwen liest, Claude prüft) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 7/25 (28 %) | 11/11 | 22 % |
| 22.08.2026, 20:43 Uhr | Zwei-Anbieter-Stack (Claude + GPT) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 22/25 (88 %) | 11/11 | 54 % |
| 22.08.2026, 19:11 Uhr | EU-Stack (nur Qwen auf Hetzner) · AnforderungswegGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 8/25 (32 %) | 11/11 | 22 % |
| 25.07.2026, 19:40 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 25/25 (100 %) | 11/11 | 89 % |
| 25.07.2026, 17:08 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 25/25 (100 %) | 11/11 | 87 % |
| 25.07.2026, 16:21 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 22/25 (88 %) | 11/11 | 98 % |
| 13.06.2026, 21:30 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 24/25 (96 %) | 11/11 | 93 % |
| 13.06.2026, 21:03 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus | 2/2 (100 %) | 1/1 | 100 % |
| 13.06.2026, 20:57 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus | 2/2 (100 %) | 1/1 | 79 % |
| 13.06.2026, 20:22 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 3 Fälle, Regressionskorpus | 6/7 (85,7 %) | 3/3 | 98 % |
| 13.06.2026, 12:07 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 25/25 (100 %) | 11/11 | 91 % |
| 13.06.2026, 11:43 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus | 3/3 (100 %) | 1/1 | 100 % |
| 11.06.2026, 06:07 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 24/25 (96 %) | 11/11 | 93 % |
| 10.06.2026, 20:34 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus | 2/2 (100 %) | 1/1 | 89 % |
| 10.06.2026, 16:09 Uhr | Hybrid-Stack (Mistral + KI-Kritiker) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 23/25 (92 %) | 11/11 | 97 % |
| 10.06.2026, 13:40 Uhr | Frontier-Stack (Claude + GPT) — historischGoldstandard-Korpus, 4 Fälle, Regressionskorpus | 9/11 (81,8 %) | 4/4 | 85 % |
| 10.06.2026, 13:39 Uhr | Baseline ohne KI (Regex)Goldstandard-Korpus, 1 Fälle, Regressionskorpus | 0/2 (0 %) | 1/1 | 100 % |
| 10.06.2026, 09:49 Uhr | EU-Stack (nur Mistral) — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 23/25 (92 %) | 11/11 | 89 % |
| 10.06.2026, 09:00 Uhr | Früher KI-Lauf — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 13/25 (52 %) | 11/11 | 82 % |
| 10.06.2026, 08:29 Uhr | Früher KI-Lauf — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus | 2/2 (100 %) | 1/1 | 49 % |
| 10.06.2026, 07:12 Uhr | Früher KI-Lauf — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 15/25 (60 %) | 11/11 | 86 % |
| 10.06.2026, 07:09 Uhr | Früher KI-Lauf — historischGoldstandard-Korpus, 3 Fälle, Regressionskorpus | 0/7 (0 %) | 4/4 | – |
| 10.06.2026, 07:06 Uhr | Früher KI-Lauf — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus | 2/2 (100 %) | 1/1 | 83 % |
| 10.06.2026, 07:04 Uhr | Früher KI-Lauf — historischGoldstandard-Korpus, 10 Fälle, Regressionskorpus | 0/25 (0 %) | 11/11 | – |
| 10.06.2026, 07:02 Uhr | Früher KI-Lauf — historischGoldstandard-Korpus, 1 Fälle, Regressionskorpus | 2/2 (100 %) | 1/1 | 83 % |
| 10.06.2026, 06:59 Uhr | Baseline ohne KI (Regex)Goldstandard-Korpus, 10 Fälle, Regressionskorpus | 3/25 (12 %) | 11/11 | 100 % |