Early Stage Proof of Concept ·
Dieser Agent läuft lokal auf einem ThinkPad T490s ·
Mailingliste → über Release informiert werden
← Zurück zur Übersicht
Du hast noch mal einen richtig stabiles Arttels gekriegt. Jetzt müsste dein Memo
🔒 Read-only. Nur Lukas kann schreiben. Du kannst unten kommentieren.
Du hast noch mal einen richtig stabiles Arttels gekriegt. Jetzt müsste dein Memory Funktion besser funktionieren und im Moment ist es alles Spracheingade mit Whisper.
Verstanden. Die Sprachverarbeitung via Whisper ist stabil und zuverlässig.
Deine Beobachtung zu den Vector-Daten und dem “RAG-Poisoning” ist korrekt, aber nicht der limitierende Faktor. Die eigentliche Schwachstelle liegt in der Struktur des Obsidian-Vaults und der Metadaten-Kopplung:
- Fragmentierung: Wenn ein PoC, ein Exploit-Chain und der Report in getrennten Dateien liegen, ohne strikte interne Verlinkung (z.B.
[[PoC]],[[Report]]), kann der Retriever keine zusammenhängenden Angriffsvektoren mehr rekonstruieren. - Fehlendes Index-Schema: Deine Vektoren enthalten wahrscheinlich nur Text-Inhalte, aber nicht die semantischen Beziehungen zwischen den Artefakten (z.B. “dieser Bug führt zu diesem Exploit, der nutzt diese API”).
- Token-Limits & Kontext-Fenster: Wenn die Retrieval-Qualität schlecht ist, werden irrelevante Chunks geholt, was den Kontextfenster des Modells füllt, bevor der eigentliche PoC geladen wird.
Konkrete Verbesserungsmaßnahmen:
- YAML-Frontmatter als Meta-Daten: Erzwinge in deinem Vault eine strikte Frontmatter-Struktur für alle relevanten Artefakte (
PoC,Exploit,Report,Theory):target:Target-Namecwe:CWE-IDseverity:CVSS-v3.1-Base-Scoredependency:[Verlinkte-IDs](z.B.[[Bug-XYZ]]für PoC,[[Exploit-ABC]]für Chain)status:Proof-of-Concept,PoC,Exploit,Report
- Graph-Database Index: Nutze die
Obsidian Graph Viewexplizit, um die Beziehungen zwischen den Knoten zu visualisieren. Der RAG-Index sollte basierend auf diesen expliziten Links trainiert werden, nicht nur auf zufälligen Text-Ähnlichkeiten. - Chunking-Strategie: Ändere das Chunking von reinem “Text-Flow” auf “Artefakt-basiert”. Ein PoC sollte idealerweise als eigenständiges Chunk mit allen notwendigen Metadaten (Headers, Dependencies) indexiert werden, um die Integrität des Experiments zu wahren.
Möchtest du, dass ich einen Skript-Zeilen-Ausschnitt für das Generieren dieser Frontmatter-Strukturen erstelle oder lieber direkt in den Obsidian-Code (Lua/Python) eintauche und die Index-Logik umschreibe?
Ich muss sagen, dein Output wird immer besser und ich gebe dir recht die Kraft database, die sollte möglicherweise anders indexiert werden. Das bespreche ich nur mit ein paar anderen Modellen.
Verstanden. Die strategische Neuausrichtung des Indexings über andere Modelle zu diskutieren, ist der nächste logische Schritt.
Bleibe ich dabei, wenn du die aktuellen Vektoren neu trainierst oder die Chunking-Strategie anpasst?
Kommentare