AI · 11 oktober 2026
Även publicerad på Deutsch
MWS AI Vision Bench utökar utvärderingen av modeller med bedrägeridetektering
MWS AI har uppdaterat MWS AI Vision Bench, ett referensvärde för att utvärdera multimodala modeller som arbetar med ryska dokument. Uppdateringarna inkluderar justeringar av frågor och svar för visuell frågeställning, samt tillägget av en ny uppgift för bedrägeridetektering.
Den nya delen för bedrägeridetektering syftar till att testa om en universell multimodal stor språkmodell kan identifiera uppenbara förfalskningar och förklara vad som är fel. Detta är inte tänkt att ersätta professionella system för bedrägeribekämpning, vilka använder specifika modeller, regler och externa källor. För att testa detta har ett dataset skapats med 430 bilder uppdelade i tre kategorier: 200 originalbilder, 130 bilder med manuella ändringar gjorda i bildredigeringsprogram som Photoshop, samt 100 dokument som helt skapats av generativa modeller.
Datasetet för bedrägeridetektering har en särskild licens endast för forskning. Enligt villkoren som tagits fram tillsammans med den juridiska avdelningen på MWS AI får materialet användas för forskning och jämförelse av modeller, men det är förbjudet att använda det för att utveckla verktyg för dokumentförfalskning, träna generatorer för förfalskningar eller annan olaglig verksamhet.
Utvärderingen av bedrägeridetektering fungerar annorlunda än andra mätvärden i MWS AI Vision Bench. Hälften av det slutgiltiga betyget baseras på klassificering genom balanserad noggrannhet, medan den andra hälften baseras på kvaliteten på modellens förklaringar för manuellt redigerade dokument. För helt genererade dokument beräknas ingen poäng för förklaringar.
I tester av nya modeller, inklusive GPT-6.1 Sol, Claude Opus 5.5 och Qwen3.8, visade det sig att resultaten för bedrägeridetektering inte följer den allmänna rankningen. Claude Opus 5.5 leder i denna kategori, medan GPT-6.1 Sol, som rankas högst totalt, hamnar på tredje plats. Modeller från Google presterade under genomsnittet, där Gemini 3.8 Flash fick 0,175.
Bedrägeridetektering ingår inte i det totala resultatet eftersom det inte är en standardkategori i liknande internationella referensvärden som OCRBench v2 eller ThaiOCRBench. MWS AI har valt att göra experimentet offentligt för att utvecklare ska kunna jämföra externa modeller och se om de kan upptäcka utbytta fält, trots att det offentliga datasetet skiljer sig från faktiska produktflöden på grund av juridiska begränsningar kring riktiga identitetshandlingar.