Du zahlst 20€/Monat für ChatGPT Plus. Oder nutzt die “kostenlose” Gemini API. Du denkst, du hast Kontrolle. Du hast sie nicht.
Was eine API wirklich ist
Eine API ist kein Werkzeug das du besitzt — es ist eine Tür die jemand anderes kontrolliert. OpenAI kann Preise ändern. Modelle deprecaten. Deine Anfragen loggen. Den Zugang sperren. Alles ohne Vorwarnung.
Das ist kein hypothetisches Risiko. Es ist Geschäftsmodell.
Der Lock-in ist technisch
`# Heute: OpenAI API
curl https://api.openai.com/v1/completions -H "Authorization: Bearer " ...
# Morgen: Migration zu lokalem Stack
curl http://localhost:8080/v1/completions ...
# Gleicher Endpoint. Andere Kontrolle.
OpenAI-kompatible APIs existieren genau deshalb — weil der Lock-in real ist und Alternativen ihn imitieren müssen um akzeptiert zu werden.
Du hast einen Snapdragon 7s Gen 3. Du läufst MNN Chat. Du bekommst ~6 tok/s. Warum nicht mehr? Und warum ist das trotzdem besser als die meisten erwarten?
Die drei Ausführungspfade
Snapdragon-Chips haben drei mögliche Backends für LLM-Inferenz: CPU, GPU (Adreno via OpenCL) und NPU (Hexagon). Derzeit sind llama.cpp und MNN-LLM für CPU-Inferenz optimiert. NPU-Unterstützung ist noch weitgehend closed-source — nur wenige Projekte wie mllm und PowerInfer-2 behaupten echten NPU-Support für mobile LLMs. arXiv
Standard-Benchmarks messen Allgemeinwissen. Nicht ob ein Modell deine Support-Tickets klassifiziert. Nicht ob es deutschen Text korrekt zusammenfasst. Nicht ob es auf deinem Gerät überhaupt läuft.
MMLU, GSM8K, HumanEval — sinnvoll für Forscher. Für dich als Self-Hoster auf Android: irrelevant.
Das Problem mit generischen Benchmarks
Standard-Coding-Benchmarks erfassen plattformspezifische Abhängigkeiten und Nuancen nicht. Developer Tech News Google hat das selbst erkannt und im März 2026 Android Bench veröffentlicht — ein Leaderboard das LLMs auf echten Android-Entwicklungsaufgaben aus öffentlichen GitHub-Repos testet. Selbst der beste Performer, Gemini 3.1 Pro, löst nur 72% der Aufgaben. Therift Auf einem spezialisierten Benchmark. Mit Datacenter-Hardware.
Vergiss llama.cpp auf Android. Es gibt eine bessere Option.
MNN Chat ist eine Open-Source-App von Alibaba. Der MNN-Inference-Engine erreicht auf Android CPU-Benchmarks eine Prefill-Geschwindigkeit von 8,6x über llama.cpp und 20,5x über fastllm, mit Decoding-Geschwindigkeiten die 2,3x bzw. 8,9x schneller sind. GitHub
Was die App kann
Text-zu-Text, Bild-zu-Text, Audio-zu-Text und Text-zu-Bild via Diffusion-Modelle — alles on-device. Google Play Unterstützte Modelle: Qwen, Gemma, Llama, DeepSeek, InternLM, Phi und mehr. GitHub
Setup
App installieren → Models Market öffnen → Modell wählen → Download → fertig. Kein Suchen im Internet nach kompatiblen Modellen — alles direkt in der App verfügbar. MakeUseOf