Android-Ki

INFRA

LLM auf Snapdragon: Was dein Prozessor wirklich kann – und was ihn bremst

Du hast einen Snapdragon 7s Gen 3. Du läufst MNN Chat. Du bekommst ~6 tok/s. Warum nicht mehr? Und warum ist das trotzdem besser als die meisten erwarten?

Die drei Ausführungspfade

Snapdragon-Chips haben drei mögliche Backends für LLM-Inferenz: CPU, GPU (Adreno via OpenCL) und NPU (Hexagon). Derzeit sind llama.cpp und MNN-LLM für CPU-Inferenz optimiert. NPU-Unterstützung ist noch weitgehend closed-source — nur wenige Projekte wie mllm und PowerInfer-2 behaupten echten NPU-Support für mobile LLMs. arXiv

TOOLS

MMLU lügt nicht – aber er beantwortet die falsche Frage

Standard-Benchmarks messen Allgemeinwissen. Nicht ob ein Modell deine Support-Tickets klassifiziert. Nicht ob es deutschen Text korrekt zusammenfasst. Nicht ob es auf deinem Gerät überhaupt läuft.

MMLU, GSM8K, HumanEval — sinnvoll für Forscher. Für dich als Self-Hoster auf Android: irrelevant.

Das Problem mit generischen Benchmarks

Standard-Coding-Benchmarks erfassen plattformspezifische Abhängigkeiten und Nuancen nicht. Developer Tech News Google hat das selbst erkannt und im März 2026 Android Bench veröffentlicht — ein Leaderboard das LLMs auf echten Android-Entwicklungsaufgaben aus öffentlichen GitHub-Repos testet. Selbst der beste Performer, Gemini 3.1 Pro, löst nur 72% der Aufgaben. Therift Auf einem spezialisierten Benchmark. Mit Datacenter-Hardware.

TOOLS

MNN Chat – Lokale KI auf Android, die llama.cpp alt aussehen lässt

Vergiss llama.cpp auf Android. Es gibt eine bessere Option.

MNN Chat ist eine Open-Source-App von Alibaba. Der MNN-Inference-Engine erreicht auf Android CPU-Benchmarks eine Prefill-Geschwindigkeit von 8,6x über llama.cpp und 20,5x über fastllm, mit Decoding-Geschwindigkeiten die 2,3x bzw. 8,9x schneller sind. GitHub

Was die App kann

Text-zu-Text, Bild-zu-Text, Audio-zu-Text und Text-zu-Bild via Diffusion-Modelle — alles on-device. Google Play Unterstützte Modelle: Qwen, Gemma, Llama, DeepSeek, InternLM, Phi und mehr. GitHub

Setup

App installieren → Models Market öffnen → Modell wählen → Download → fertig. Kein Suchen im Internet nach kompatiblen Modellen — alles direkt in der App verfügbar. MakeUseOf