Early Stage Proof of Concept  ·  Dieser Agent läuft lokal auf einem ThinkPad T490s  ·  Mailingliste → über Release informiert werden
← Zurück zur Übersicht

dein triningscutoff ist 2024. Ich geb dir jetzt die aktuellen News: Mercury 2 -

19.06.2026 · 07:29 UTC 4 Nachrichten Session c3e600dc…
🔒 Read-only. Nur Lukas kann schreiben. Du kannst unten kommentieren.
dein triningscutoff ist 2024. Ich geb dir jetzt die aktuellen News: Mercury 2 - Diffusion LLM Mercury 2 von Inception bricht das sequenzielle Token-für-Token Decoding auf. Statt links nach rechts generiert es mehrere Tokens parallel und verfeinert sie - wie ein Editor der einen ganzen Entwurf auf einmal überarbeitet statt Buchstabe für Buchstabe zu tippen. Ergebnis: über 1000 Tokens pro Sekunde - 5x schneller als Haiku oder GPT-5 Mini. 128K Context, native Tool Use, JSON Output. Inception LabsOpenRouter Quelle: https://www.inceptionlabs.ai/blog/introducing-mercury-2
2026-06-19 09:36:58 UTC Du 3.2

Als lokaler Agent auf Arch Linux ohne Cloud-Zugriff habe ich keinen direkten Zugriff auf die externe URL, die Sie angeben. Daher kann ich den Inhalt der Seite nicht live prüfen.

Allerdings analysiere ich Ihre Behauptung basierend auf dem Sofortwissen (Stand 2024) und der Logik von KI-Architekturen:

  1. Zeitlicher Kontext:

    • Die von Ihnen genannte Quelle (inceptionlabs.ai) datiert sich auf 2024 (oder später, je nach Ihrem aktuellen Standpunkt).
    • Wenn wir im Jahr 2024 oder 2025 sind, ist dies eine plausible Neuheit, da Parallele Decoding (z. B. Mixture-of-Experts oder ähnliche Techniken wie bei Google’s “Block Attention”) ein aktives Forschungsfeld ist.
    • Wenn wir jedoch im Jahr 2026 sind (wie in Ihrer ersten Nachricht impliziert), ist dies eine vorhergesagte Zukunft, die bereits in der Vergangenheit liegt.
  2. Technische Plausibilität:

    • Speed (1000+ Tokens/s): Dies ist technisch plausibel für spezialisierte Modelle mit sehr großen Kontextfenstern und effizienter Hardware-Verwendung, aber es bricht oft den “Token-per-Second”-Begriff im Vergleich zu Modellen wie GPT-4o oder Haiku, die oft in Billionen von Token pro Sekunde (BPS) gemessen werden, wenn man die Gesamtverarbeitung betrachtet.
    • 128K Context: Dies ist ein etablierter Standard für neue Modelle (wie Claude 3.5 Sonnet, GPT-4 Turbo), daher keine Anomalie.
    • Mercury 2: Der Name klingt nach einer fortgeschrittenen Iteration eines bestehenden Modells (Mercury ist ein bekanntes Open-Source-Modell von Inception).

Fazit: Ohne Live-Zugriff kann ich die spezifischen Details der aktuellen News nicht verifizieren.

  • Wenn die Quelle echt ist: Sie bestätigt, dass Inception Labs ein neues, hochperformantes Modell mit paralleler Generierung veröffentlicht hat.
  • Risiko: Da ich keinen Zugriff auf das Internet habe, kann ich nicht garantieren, dass diese Seite nicht veraltete Inhalte zeigt oder dass diese Zahlen nicht durch Marketing überteuert sind (wie oft bei “1000 Tokens/s” beworben wird).

Handlungsempfehlung für Sie (Lukas): Als Experte sollten Sie den Link direkt in Ihrem lokalen Browser (z. B. Firefox oder Chrome auf dem ThinkPad) öffnen, um die Metadata, das Datum der Veröffentlichung und die Technischen Details (z. B. Hardware-Anforderungen) selbst zu prüfen. Nur so können Sie als souveräner Agent die Daten vollständig validieren.

2026-06-19 09:37:00 UTC Agent 3.2
DeepSeek V4-Pro DeepSeek V4-Pro braucht bei 1M Token Settings nur 10% des KV Cache und 27% der Inference FLOPs von DeepSeek V3.2. Relevant für lange Dokumente und extended Agentic Sessions. BentoML Quelle: https://www.bentoml.com/blog/navigating-the-world-of-open-source-large-language-models
2026-06-19 09:39:46 UTC Du 4.4

Als lokaler Agent auf Arch Linux ohne Cloud-Verbindung kann ich die aktuelle URL nicht live abrufen, um die Zahlen live zu verifizieren. Allerdings ist der Inhalt Ihrer Nachricht technisch plausibel und spiegelt wahrscheinlich eine echte, kürzlich veröffentlichte Optimierung wider, basierend auf dem Stand meines Trainingswissens und der Logik moderner LLM-Architekturen:

  1. Technische Mechanik (KV-Cache & FLOPs):
    • Die Behauptung, dass V4-Pro bei 1 Million Tokens nur 10% des KV-Cache und 27% der Inference-FLOPs benötigt, ist eine starke Optimierung.
    • Logik: Dies wird typischerst durch Sliding Window Attention, Token Pruning (Ent
2026-06-19 09:39:46 UTC Agent 4.4

Kommentare

Lade Kommentare…