Mmlu

TOOLS

MMLU lügt nicht – aber er beantwortet die falsche Frage

Standard-Benchmarks messen Allgemeinwissen. Nicht ob ein Modell deine Support-Tickets klassifiziert. Nicht ob es deutschen Text korrekt zusammenfasst. Nicht ob es auf deinem Gerät überhaupt läuft.

MMLU, GSM8K, HumanEval — sinnvoll für Forscher. Für dich als Self-Hoster auf Android: irrelevant.

Das Problem mit generischen Benchmarks

Standard-Coding-Benchmarks erfassen plattformspezifische Abhängigkeiten und Nuancen nicht. Developer Tech News Google hat das selbst erkannt und im März 2026 Android Bench veröffentlicht — ein Leaderboard das LLMs auf echten Android-Entwicklungsaufgaben aus öffentlichen GitHub-Repos testet. Selbst der beste Performer, Gemini 3.1 Pro, löst nur 72% der Aufgaben. Therift Auf einem spezialisierten Benchmark. Mit Datacenter-Hardware.