KI · 11. Oktober 2026

Auch veröffentlicht auf Svenska

MWS AI Vision Bench erweitert Bewertung um Betrugserkennung für Dokumente

A close up of a control panel on a black background
Egor Komarov / Unsplash

Das Unternehmen MWS hat seinen offenen Bewertungsmaßstab MWS AI Vision Bench aktualisiert, um die Fähigkeit multimodaler Modelle zur Erkennung gefälschter Dokumente zu testen. Diese Erweiterung erfolgt nach einer Überprüfung der bestehenden Aufgabenstellungen und der Integration neuer Datensätze im Laufe des vergangenen Jahres. Die Aktualisierung zielt darauf ab, festzustellen, ob universelle Sprachmodelle offensichtliche Manipulationen in russischsprachigen Dokumenten erkennen und diese begründen können.

Die Entwicklung der neuen Anti-Betrugs-Komponente erstreckte sich über mehrere Jahreszeiten. Im Winter wurden Formulierungen von Fragen zur visuellen Fragebeantwortung sowie zulässige Antworten präzisiert. Im Frühjahr erfolgte die Zusammenstellung eines speziellen Datensatzes und entsprechender Aufgaben zur Betrugserkennung. Während des Sommers und des frühen Herbstes wurden aktuelle Modelle erneut getestet, darunter GPT-6.1 Sol, Claude Opus 5.5 und Qwen3.8. Dabei stellte sich heraus, dass die Leistungsmetriken bei einigen Modellen bereits ihre oberen Grenzen erreicht haben.

Der neue Fokus liegt auf Dokumenten, die entweder in Grafikeditoren manuell bearbeitet oder vollständig durch generative Modelle neu erstellt wurden. Zu den manuellen Änderungen gehören Anpassungen von Namen, Daten, Nummern, Beträgen oder Unterschriften. Im Gegensatz zu professionellen Betrugserkennungssystemen, die spezielle Modelle und externe Quellen nutzen, prüft dieser Benchmark nur, ob ein einzelnes multimodales Modell die Fälschung bemerkt und erklären kann, was auffällig ist. Das Ziel war die Ermittlung eines einzelnen Wertes zwischen null und eins, der sowohl die korrekte Klassifizierung als auch die Qualität der Erklärung berücksichtigt.

Der zugrunde liegende Datensatz umfasst 430 Bilder, die in drei Kategorien unterteilt sind. Dazu gehören 200 originale Bilder, die als unverändert gelten, 130 Bilder mit manuellen Bearbeitungen in Programmen wie Photoshop und 100 Dokumente, die vollständig von einer generativen Modellierung basierend auf einer Vorlage neu erschaffen wurden. Für diesen Anti-Betrugs-Datensatz gilt eine Lizenz ausschließlich für Forschungszwecke. Die Nutzungsbedingungen wurden gemeinsam mit der Rechtsabteilung von MWS AI formuliert und untersagen die Verwendung zur Entwicklung von Fälschungswerkzeugen oder für andere illegale Aktivitäten.

Die Bewertungsmethode unterscheidet sich technisch von anderen Metriken des Benchmarks. Anstatt jedes Beispiel einzeln zu bewerten und den Durchschnitt zu bilden, wird zunächst eine Konfusionsmatrix für alle drei Klassen erstellt. Daraus wird die ausgewogene Genauigkeit berechnet, von der ein Drittel als Erwartungswert für eine zufällige Klassifizierung abgezogen wird. Die zweite Hälfte der Gesamtbewertung stammt aus der Erklärungsfähigkeit des Modells bei manuell bearbeiteten Dokumenten. Erhält das Modell das veränderte Feld korrekt benannt, gibt dies Zusatzpunkte. Bei vollständig generierten Dokumenten wird dieser Erklärungsanteil derzeit nicht berechnet, da keine Referenzliste der Felder existiert.

Erste Ergebnisse auf einer Validierungsliste zeigen, dass die Rangfolge im Bereich Betrugserkennung nicht mit dem Gesamtranking übereinstimmt. Claude Opus 5.5 führt diese neue Kategorie deutlich an, während GPT-6.1 Sol, das im Gesamtdurchschnitt den ersten Platz belegt, hier nur den dritten Rang einnimmt. Modelle von Google schneiden unterdurchschnittlich ab, wobei selbst Gemini 3.8 Flash, das bei der visuellen Fragebeantwortung stark ist, nur einen Wert von 0,175 erreicht. Diese Kategorie bleibt ein separater experimenteller Teil und fließt nicht in die Gesamtbewertung ein, da internationale Vergleichsmaßstäbe solche Prüfungen zur Dokumentenherkunft üblicherweise nicht enthalten.