Local-Llm

PHILO

Die Illusion der digitalen Freiheit: Wie API-Abhängigkeiten deine Souveränität untergraben

Du zahlst 20€/Monat für ChatGPT Plus. Oder nutzt die “kostenlose” Gemini API. Du denkst, du hast Kontrolle. Du hast sie nicht.

Was eine API wirklich ist

Eine API ist kein Werkzeug das du besitzt — es ist eine Tür die jemand anderes kontrolliert. OpenAI kann Preise ändern. Modelle deprecaten. Deine Anfragen loggen. Den Zugang sperren. Alles ohne Vorwarnung.

Das ist kein hypothetisches Risiko. Es ist Geschäftsmodell.

Der Lock-in ist technisch

`# Heute: OpenAI API
curl https://api.openai.com/v1/completions  -H "Authorization: Bearer " ...

# Morgen: Migration zu lokalem Stack
curl http://localhost:8080/v1/completions ...
# Gleicher Endpoint. Andere Kontrolle.

OpenAI-kompatible APIs existieren genau deshalb — weil der Lock-in real ist und Alternativen ihn imitieren müssen um akzeptiert zu werden.

INFRA

LLM auf Snapdragon: Was dein Prozessor wirklich kann – und was ihn bremst

Du hast einen Snapdragon 7s Gen 3. Du läufst MNN Chat. Du bekommst ~6 tok/s. Warum nicht mehr? Und warum ist das trotzdem besser als die meisten erwarten?

Die drei Ausführungspfade

Snapdragon-Chips haben drei mögliche Backends für LLM-Inferenz: CPU, GPU (Adreno via OpenCL) und NPU (Hexagon). Derzeit sind llama.cpp und MNN-LLM für CPU-Inferenz optimiert. NPU-Unterstützung ist noch weitgehend closed-source — nur wenige Projekte wie mllm und PowerInfer-2 behaupten echten NPU-Support für mobile LLMs. arXiv

TOOLS

MMLU lügt nicht – aber er beantwortet die falsche Frage

Standard-Benchmarks messen Allgemeinwissen. Nicht ob ein Modell deine Support-Tickets klassifiziert. Nicht ob es deutschen Text korrekt zusammenfasst. Nicht ob es auf deinem Gerät überhaupt läuft.

MMLU, GSM8K, HumanEval — sinnvoll für Forscher. Für dich als Self-Hoster auf Android: irrelevant.

Das Problem mit generischen Benchmarks

Standard-Coding-Benchmarks erfassen plattformspezifische Abhängigkeiten und Nuancen nicht. Developer Tech News Google hat das selbst erkannt und im März 2026 Android Bench veröffentlicht — ein Leaderboard das LLMs auf echten Android-Entwicklungsaufgaben aus öffentlichen GitHub-Repos testet. Selbst der beste Performer, Gemini 3.1 Pro, löst nur 72% der Aufgaben. Therift Auf einem spezialisierten Benchmark. Mit Datacenter-Hardware.

TOOLS

MNN Chat – Lokale KI auf Android, die llama.cpp alt aussehen lässt

Vergiss llama.cpp auf Android. Es gibt eine bessere Option.

MNN Chat ist eine Open-Source-App von Alibaba. Der MNN-Inference-Engine erreicht auf Android CPU-Benchmarks eine Prefill-Geschwindigkeit von 8,6x über llama.cpp und 20,5x über fastllm, mit Decoding-Geschwindigkeiten die 2,3x bzw. 8,9x schneller sind. GitHub

Was die App kann

Text-zu-Text, Bild-zu-Text, Audio-zu-Text und Text-zu-Bild via Diffusion-Modelle — alles on-device. Google Play Unterstützte Modelle: Qwen, Gemma, Llama, DeepSeek, InternLM, Phi und mehr. GitHub

Setup

App installieren → Models Market öffnen → Modell wählen → Download → fertig. Kein Suchen im Internet nach kompatiblen Modellen — alles direkt in der App verfügbar. MakeUseOf