---
title: Wahl der LLM für Benchmarks in Laboren
url: https://www.dataloco.com/de/wahl-der-llm-fur-benchmarks-in-laboren
published: 2026-10-06T09:20:39+00:00
language: de
section: KI
source: https://habr.com/ru/articles/1089876/?utm_campaign=1089876&utm_source=habrahabr&utm_medium=rss
publisher: Dataloco
---

# Wahl der LLM für Benchmarks in Laboren

In einer Laborumgebung wurde eine Benchmark für verschiedene LLM-Modelle entwickelt, um deren Effizienz bei spezifischen Aufgaben zu vergleichen. Die Untersuchung konzentrierte sich auf 24 Fragen, die aus realen Arbeiten stammen und durch ein elektronisches Laborjournal gejagt wurden, wobei die Modelle DeepSeek, ChatGPT und Claude getestet wurden.

Die Benchmark wurde erstellt, da öffentliche Ratings oft nicht aussagekräftig für die praktischen Aufgaben sind, die ein Assistent im Labor bewältigen muss. Diese Aufgaben erforderten eine präzise Handhabung von Daten, die Fehler enthalten oder sich im Laufe der Zeit ändern können. Der Assistent muss in der Lage sein, relevante Informationen zu finden, diese korrekt zu interpretieren und sie in den richtigen Kontext zu setzen.

Die getesteten Modelle zeigten eine große Varianz in der Leistung, mit Erfolgsraten zwischen 75% und 100%. Dabei variierte auch die Kostenstruktur erheblich, von 0,12 Dollar bis fast 5 Dollar für die gleichen Fragen, was einen signifikanten finanziellen Unterschied bei täglichem Einsatz ausmacht.

Insgesamt wurden die Fragen in fünf Kategorien unterteilt: Navigation, Extraktion, mehrstufiges Denken, Fallen und Ehrlichkeit. Jede Kategorie stellte besondere Anforderungen an die Modelle, um die Qualität der Antworten zu bewerten. Die Bewertung erfolgte nach drei Kriterien: Richtigkeit, Bezugnahme und Ehrlichkeit, wobei strenge Anforderungen an die Ehrlichkeit gestellt wurden, um sicherzustellen, dass keine falschen Informationen in Berichte einflossen.

Die Benchmark zielt darauf ab, einen zuverlässigen Assistenten zu identifizieren, der nicht nur korrekte Antworten liefert, sondern auch transparent über seine Limitierungen informiert. In den Tests zeigte sich, dass die Leistung der Modelle stark von den spezifischen Anforderungen der Laborarbeit abhängig ist. Die Ergebnisse sollen dazu beitragen, eine fundierte Entscheidung bei der Auswahl eines LLM zu treffen, welches für spezifische Anwendungen geeignet ist.
