7.3 KiB
LLM Knowledge Base: System Zarządzania Wiedzą (Karpathy Pattern)
Ten projekt to zaawansowana osobista baza wiedzy (Knowledge Base), która jest aktywnie współtworzona i utrzymywana przez agenta AI (LLM). Zamiast tradycyjnego, ulotnego podejścia RAG (Retrieval-Augmented Generation), system ten stopniowo buduje i syntetyzuje wiedzę w trwałą, skompilowaną strukturę połączonych plików Markdown.
🧠 Filozofia i Architektura
System opiera się na trzech filarach:
- Karpathy Pattern (Knowledge as a Codebase): Surowe, niezmienne dokumenty (
raw/) są jak kod źródłowy, a uporządkowana, powiązana baza wiedzy (knowledge/) jest skompilowanym plikiem binarnym — zoptymalizowanym pod kątem wyszukiwania, gęstości informacji i syntezy. Obsidian służy jako interfejs (frontend IDE), a LLM jako programista i administrator bazy (bookkeeper). - 12 Problemów Feynmana: Metoda polegająca na trzymaniu w pamięci kluczowych pytań badawczych (w pliku
knowledge/feynman_problems.md). Każde nowe źródło jest testowane pod kątem tego, czy wnosi wgląd do tych długoterminowych wyzwań. - Local-First & AI Automation: Priorytetem są lokalne pliki tekstowe, prywatność i niezależność od chmury. Agent AI wkracza tylko do zadań wymagających wysokiego poziomu syntezy (Ingest, Query, Lint), nie generując kosztów tokenów przy codziennym przeglądaniu bazy.
📂 Struktura Katalogów
brain/
├── raw/ ← Źródła Prawdy (Niezmienne, dodawane przez człowieka)
│ ├── articles/ ← Artykuły z sieci, blogi
│ ├── inbox/ ← Pliki oczekujące na przetworzenie (ingest)
│ ├── notes/ ← Twoje surowe notatki i przemyślenia
│ └── transcripts/ ← Transkrypcje audio/video
│
├── knowledge/ ← Warstwa Syntezy (Zarządzana w 100% przez LLM)
│ ├── summaries/ ← Podsumowania poszczególnych źródeł z raw/
│ ├── concepts/ ← Słownik terminów i modeli mentalnych (np. gtd-ai)
│ ├── entities/ ← Strony narzędzi, organizacji i osób (np. obsidian)
│ ├── indices/ ← Listy indeksujące zawartość według typów i tematów
│ ├── journal/ ← Dziennik badawczy (Research Journal) do luźnych zapisków
│ ├── index.md ← Master Index (Główna Mapa bazy wiedzy)
│ ├── log.md ← Chronologiczny dziennik zmian i operacji ingestu
│ └── feynman_problems.md ← Centralny rejestr 12 Ulubionych Problemów Feynmana
│
├── .agents/skills/ ← Zainstalowane umiejętności agenta AI (Obsidian-Skills)
├── GEMINI.md ← Zasady, instrukcje i konfiguracja dla Gemini CLI
├── lint_knowledge.ps1 ← Lokalny skrypt walidacyjny (linter powiązań i sierot)
└── replace_knowledge.ps1 ← Skrypt PowerShell do globalnych refaktoryzacji tekstu
🚀 Trzy Główne Przepływy (Workflows)
1. Ingest (Wdrażanie wiedzy)
Dodawanie nowych źródeł polega na umieszczeniu pliku w raw/inbox/ i zleceniu agentowi:
"Zrób ingest nowo dodanych plików"
Co robi agent AI:
- Analizuje surowy tekst z
raw/inbox/. - Tworzy dedykowaną stronę podsumowania w
knowledge/summaries/(z metadanymi YAML i kluczowymi punktami). - Mnożnik Ingestu: Średnio jedno źródło aktualizuje lub tworzy 2.6 strony w bazie. Agent automatycznie tworzy/uzupełnia odpowiednie strony w
knowledge/concepts/orazknowledge/entities/i linkuje je ze sobą. - Testuje nowe wnioski pod kątem 12 Problemów Feynmana w
knowledge/feynman_problems.mdi dopisuje powiązania. - Aktualizuje odpowiednie indeksy tematyczne oraz plik
knowledge/log.md.
2. Query (Zadawanie pytań)
Dzięki gęstej sieci połączeń możesz zadawać złożone pytania syntezujące wiele źródeł:
"Jakie są różnice metodologiczne między wdrażaniem bazy w filozofii a systemem GTD AI? Przygotuj porównanie w oparciu o nasze źródła."
Co robi agent AI: Zamiast przeszukiwać gigabajty surowych PDF-ów, agent odpytuje master index, przechodzi po Knowledge BaseLinkach powiązanych koncepcji i generuje precyzyjną odpowiedź z cytowaniami. Wskazówka: Wartościowe syntezy wygenerowane w sesjach czatu mogą być zapisywane z powrotem do bazy jako nowe strony koncepcyjne lub syntezy, dzięki czemu wiedza procentuje (compounding knowledge).
3. Lint (Sprzątanie i walidacja)
Aby utrzymać bazę w idealnym zdrowiu, regularnie uruchamia się proces Lintingu:
"Uruchom linter wiedzy"
System posiada wbudowany, dedykowany skrypt walidacyjny PowerShell. Możesz go uruchomić bezpośrednio z konsoli:
powershell.exe -NoProfile -ExecutionPolicy Bypass -File .\lint_knowledge.ps1
Co robi linter:
- Przeszukuje całą bazę pod kątem uszkodzonych Knowledge BaseLinków (linki wskazujące na nieistniejące pliki).
- Wykrywa sieroty (orphans) — strony koncepcyjne, podmioty lub podsumowania, które nie posiadają żadnych linków przychodzących z innych stron merytorycznych.
- Gwarantuje 100% spójności strukturalnej przed zatwierdzeniem zmian w systemie kontroli wersji Git.
💎 Zaawansowane Funkcje Systemu
🏷️ Markery Epistemiczne (Epistemic Markers)
Aby zachować pełen rygor badawczy, w plikach syntezowanych stosujemy oznaczanie rejestru zdań:
- (brak znacznika) — Bezpośrednie twierdzenie pochodzące z cytowanego źródła pierwotnego.
- [W] — Knowledge Base synthesis: Integracja i synteza merytoryczna dokonana przez model AI (LLM) na bazie wielu źródeł.
- [P] — Personal stance: Suwerenne stanowisko badawcze, hipoteza lub argument samego człowieka (użytkownika).
- [?] — Speculative: Informacja niepewna, trudna do zweryfikowania przez bazę (potencjalna halucynacja).
⚡ Umiejętności Obsidiana (Obsidian-Skills)
Agent AI posiada zainstalowane natywne reguły obsługi formatu Obsidian (Knowledge BaseLinki, callouty, Canvas). Zostały one wdrożone za pomocą komendy:
npx skills add https://github.com/kepano/obsidian-skills.git
Dzięki temu model nie generuje błędnej składni i traktuje bazę notatek z taką samą precyzją, jak profesjonalny kompilator traktuje kod źródłowy.
📈 Skalowanie Bazy (Knowledge Scaling)
W miarę wzrostu bazy powyżej 150 stron, aby zapobiec eksplozji kosztów tokenów i spowolnieniu zapytań, baza stosuje kaskadę nawigacyjną:
- Podział na klastry tematyczne w
index.md. - Stworzenie dedykowanych stron syntez (synthesis pages) agregujących całe obszary (np.
syntheses/porownanie-strategii-automatyzacji-ai). - Zastosowanie lokalnych serwerów MCP (Model Context Protocol) (np.
MCPVault), które indeksują bazę lokalnie i kompresują odpowiedzi przekazywane do agenta AI o 40-60%.
📑 Kontrakt Agentów (CLAUDE.md / GEMINI.md)
Pliki te pełnią rolę instrukcji wdrożeniowych (kontraktu) dla agenta AI. Definiują nienaruszalne reguły bezpieczeństwa (np. zakaz modyfikacji szablonów i folderów systemowych) oraz aktualny fokus badawczy użytkownika, co pozwala na pełną powtarzalność pracy między bezstanowymi sesjami modeli językowych.
Ostatnia pełna rekompilacja i walidacja bazy: 2026-06-09