17 KiB
title, source, author, published, created, description, tags
| title | source | author | published | created | description | tags | |||
|---|---|---|---|---|---|---|---|---|---|
| Jak zbudować drugi mózg, któremu naprawdę możesz zaufać, korzystając z myKG i Obsidianu | https://medium.com/@senol.isci/how-to-build-a-second-brain-you-can-actually-trust-52ac621188b7 |
|
2026-06-08 | 2026-06-11 | More |
|
LLM może przekształcić folder notatek w graf wiedzy jednym poleceniem. Trudniejsze nie jest jej zbudowanie. Trudne jest zaufanie do tego.
Problem
Pewnie już widziałeś to demo. Wskazujesz model językowy na folder z notatkami w Markdown, a on oddaje ci wykres wiedzy: byty, relacje, sieć, którą możesz przeszukiwać. Wygląda imponująco.
Potem próbujesz go faktycznie użyć, a jedno pytanie cię zatrzymuje: które z tych połączeń są w ogóle prawdziwe?
To pytanie jest trudne, ponieważ prosty pipeline "LLM czyta moje notatki, potem buduje bazę wiedzy" zwykle zawodzi na dwa sposoby, a oba błędy są ciche. Po pierwsze, wymyśla rzeczy: model określa relację, której notatki nigdy nie powiedziały, a teraz to fałszywe twierdzenie wygląda dokładnie tak samo jak prawdziwe. Po drugie, traci pewne rzeczy: model natrafia na fakt, którego nie potrafi sklasyfikować, i zamiast ci o tym powiedzieć, po prostu go porzuca. Żadne promptowe rozwiązania nie rozwiązują żadnego z tych sposobów, bo problem nie leży w tym, o co pytasz model, tylko w tym, że nic nie sprawdza, co daje z powrotem. Zaufanie nie wynika z jednej sprytnej instrukcji. Wynika to ze struktury: jasnych zasad dotyczących dozwolonych działań, testów, które mogą się nie zdać, oraz zapisu, który można samodzielnie sprawdzić.
Rozwiązanie: myKG
Dlatego zbudowałem myKG. Nie byłem zadowolony z istniejących narzędzi do ekstrakcji grafów wiedzy, które często dawały imponująco, ale trudne do zaufania wyniki.
myKG to narzędzie open-source, które buduje wykresy wiedzy z folderu dokumentów o mieszanym formacie. Został zaprojektowany dokładnie wokół tego pytania: które z tych węzłów i połączeń są prawdziwe?
Wciąż używa LLM do czytania notatek. Różnica polega na tym, że wszystko jest zbudowane wokół tego LLM. Wynik to nie tylko wykres, to wykres, który możesz sprawdzić:
- Każdy węzeł, link i atrybut otrzymuje wskaźnik zaufania (od 0 do 1) oraz listę plików źródłowych, z których pochodzi. Każde roszczenie można prześledzić aż do oryginalnego tekstu.
- Schemat jest najpierw zapisywany i sprawdzany, więc wykres może zawierać tylko te rzeczy i linki, które określiłeś, że są dozwolone.
- Nic niepewnego nie zostaje cicho zamienione w fakt, a nic, czego model nie potrafi umiejscowić, zostaje cicho wyrzucone. Model może powiedzieć "Nie jestem pewien" lub "Nie wiem."
Działa też bezpośrednio w narzędziach, których już używasz. myKG można uruchomić z Claude Code przez tę umiejętność.**/mykg**
(zobacz Od dokumentów do żywego wykresu wiedzy: Wprowadzenie myKG, aby uzyskać więcej szczegółów)
Przygotowanie:
Najpierw zainstaluj pakiet i włącz tryb agenta z Claude Code: instaluje on umiejętność i tworzy lub aktualizuje plik, żeby agent wiedział, jak prowadzić pipeline.--profile agent-claude-code /mykg CLAUDE.md
pip install mykg
mykg init --profile agent-claude-code
Następnie otwórz terminal (na przykład w VS Code), uruchom kod Claude z folderu projektu i uruchom pipeline z./mykg
Umiejętność sprawdza, czy tryb agenta jest włączony, rozpoczyna sesję i rozpoczyna pętlę przetwarzania, wysyłając podagenta dla każdego kroku:
# Inside Claude Code (drives the LLM steps via the agent skill):
/mykg extract notes/
Przykład: poznaj korpus
Aby każde zgłoszenie było konkretne, reszta tego artykułu śledzi jeden prawdziwy bieg od początku do końca, przez cztery krótkie notatki w Markdown o wymyślonej firmie o nazwie "Acme Corp." Zanim spojrzysz na jakiekolwiek wyniki, warto wiedzieć, co faktycznie znajduje się w tych notatkach, ponieważ zaufanie sprowadza się do tego, czy wykres odpowiada tekstowi.
(Pliki demo są tutaj)
**team.md**: który pracuje w Acme. Alice Chen (starsza inżynierka z dyplomem z MIT), CTO James Whitfield (doktorat ze Stanford), CEO Sandra Kim, dyrektor Bob Martinez oraz zespoły, którymi zarządzają.**projects.md**: co budują. Migracja bazy danych do AWS Aurora, pipeline RAG prowadzony przez dr Yunę Park oraz usługa sekretów platformy, a także informacja, kto jest właścicielem i współtworzy każdą z nich.**technologies.md**: stos technologiczny. PostgreSQL, Pinecone (wybrany zamiast Weaviate i Qdrant, które zostały rozpatrzone i odrzucone), GitHub Actions, Kubernetes, PyTorch, Python, Go oraz który zespół używa którego narzędzia.**partners.md**: świat poza Acme. Formalne partnerstwo z DataSystems Inc, luźniejsza relacja "nieformalna doradcza" z NovaTech (notatki mówią, że "nie ma aktywnego kontraktu komercyjnego") oraz dostawcami takimi jak HashiCorp i AWS.
Te nuty celowo mieszają wszystko. Niektóre fakty są jasno przedstawione i powtarzane w różnych aktach. Niektóre są zabezpieczone. Niektórzy pojawiają się tylko raz, przelotnie. Ta mieszanka ma znaczenie: wiarygodny pipeline powinien traktować te sprawy inaczej, zamiast spłaszczać je wszystkie do tego samego rodzaju "faktów".
Ten przebieg generuje graf z 44 węzłami i 49 linkami, który przechodzi walidację bez problemu (zobacz wynik z przebiegu tutaj). Kolejne cztery sekcje krok po kroku przechodzą przez proces i pokazują, gdzie faktycznie buduje się zaufanie na każdym etapie.
Pass 1 buduje schemat i go sprawdza
Większość narzędzi do "notatek do wykresów" zaczyna od wyciągania rzeczy: ludzi, projektów, narzędzi. myKG zaczyna o krok wcześniej, decydując, jakie rzeczy w ogóle mogą istnieć na wykresie.
Zanim wyodrębni pojedynczy przykład, Pass 1 buduje schemat: małą, typowaną strukturę wymieniającą kategorie rzeczy (zwane pojęciami) oraz typowe relacje dozwolone do ich połączenia. Z tych czterech notatek powstaje sześć pojęć (,,,,, ) oraz dwanaście relacji, z których każda ma jasno określony typ źródła i typ celu:Person Organization Team Project Technology Location
{ "name": "uses_technology", "domain": "Project", "range": "Technology" }
To nie jest tylko miły przedmiot. Schemat jest sprawdzany w bibliotece rdflib przed jakąkolwiek ekstrakcją. Źródło i typ docelowy każdego związku musi wskazywać na pojęcie, które zostało faktycznie zadeklarowane. Jeśli schemat nie przejdzie tego testu, nic nie zostanie wyodrębnione.
myKG zawiera osobny mechanizm człowieka w pętli, który pozwala człowiekowi wejść i edytować schemat, jeśli chce, zanim zostanie zablokowany do ekstrakcji.
Schemat jest też dopracowany, nie tylko generowany raz i pozostawiany bez przerwy. myKG utrzymuje ruch, a w tym przebiegu zanotował trzy kroki, z których każdy dopracowywał zadanie:schema_history
Tak wygląda Pass 1 w terminalu: cztery notatki są odczytywane, jedna partia trafia do budowy schematu, a powstały schemat jest dopracowywany przez kroki harmonizacji i oceny jakości do czystych sześciu koncepcji i dwunastu relacji:
Przejdź 2 ekstrakcje z pewnością na każdym ziarnie
Gdy schemat jest już zablokowany, Pass 2 czyta każdą nutę i wyciąga konkretne elementy oraz relacje, które do niej pasują. I tutaj "model tak powiedział" nie jest traktowane jako proste tak lub nie. myKG przypisuje punkt pewności do każdego elementu grafu: każdego węzła, każdego atrybutu, każdego linku. Oto węzeł w skarbcu Obsidian z tego biegu:
Ten sam poziom szczegółowości niesie niepewność do przodu, zamiast ją ukrywać. Wyraźnie określone wyniki partnerstwa Acme-to-DataSystems.0.95
Relacja Acme-NovaTech, którą same notatki opisują jako "nieformalną współpracę doradczą" bez "aktywnej umowy handlowej", osiąga niższy wynik –. A gdy model naprawdę czegoś nie wie, ta luka nie znika: notatka Boba Martineza wspomina o jego stanowisku, ale nie o e-mailu czy wykształceniu, więc te dwie cechy są zapisane jako szczere "nie wiemy", a nie cicha pustka, którą sam musiałbyś zauważyć.0.85 {"value": null, "confidence": 0.0}
Oto przepustka 2 działająca w terminalu. Pobiera z wszystkich czterech plików w jednej partii i raportuje, gdy duplikaty z różnych plików zostały połączone:44 node(s), 49 edge(s)
Walidacja, która nie pyta o opinię modelu
Wyniki pewności są przydatne, ale nadal są miękkim sygnałem, miarą pewności modelu. Niektóre testy muszą być trudniejsze. Gdy graf jest w pełni złożony, myKG uruchamia osobny przebieg walidacyjny swojej struktury: czyste sprawdzanie reguł, bez udziału LLM. Relacja typu, na przykład, musi przebiegać od a do. Bez wyjątków. Jeśli relacja łamie deklarowane źródło lub typ celu, to błąd, a nie kwestia opinii.uses_technology Project Technology
{ "valid": true, "tbox_checks": { "errors": [] }, "abox_checks": { "errors": [] } }
Ten test nie może powiedzieć, czy dany fakt jest prawdziwy. Gwarantuje to, że wszystko na wykresie przynajmniej ma kształt, jaki schemat sugeruje, że powinien mieć. Model nie ma tu nic do powiedzenia.
Pozwalając modelowi powiedzieć "nie"
Niektóre decyzje naprawdę wymagają rozsądku. A najważniejszym wyborem projektowym myKG jest pozwolenie, by ta ocena była " nie".
Po złożeniu grafu niektóre węzły nie mają żadnych połączeń, "sieroty", które pojawiają się w tekście, ale nie łączą się wyraźnie z niczym innym. Prosta zasada oparta na tym, które słowa pojawiają się blisko siebie (bez udziału LLM), sugeruje możliwe powiązania tych sierot. Następnie model jest proszony o potwierdzenie lub odrzucenie każdej sugestii i wyraźnie może odmówić. W tym przebiegu odmówił każdej sugestii (log odrzuceń pokazuje 52 odrzucenia), pozostawiając trzynaście węzłów szczerze mówiąc niepołączonych, zamiast wymuszać połączenia, które tak naprawdę nie istniały. Te trzynaście dzieli się na dwie grupy, a notatki zostały napisane tak, by pokazać obie:
- Rzeczy, które brzmią wiarygodnie, ale nie są faktycznie zgłaszane. oraz są to bazy wektorowe, które według nich zostały rozpatrzone i odrzucone na rzecz Pinecone. To prawdziwe słowa, które pojawiają się w notatkach, ale tekst nigdy nie wskazuje ich relacji.
qdrantweaviatetechnologies.md - Rzeczy, które są prawdziwe, ale schemat nie ma miejsca. Alice Chen naprawdę ma dyplom z MIT, a zespół badawczy AI naprawdę korzysta z PyTorch. Oba są faktami przedstawionymi. Ale ten schemat nie ma związku z edukacją, a jego jedyny związek z wykorzystaniem technologii przebiega od do, a nie od do. Nie ma szczerego związku z rysowaniem, więc żadne nie jest rysowane.
Person → OrganizationProjectTechnologyTeamTechnology
Narzędzie zoptymalizowane, by wyglądać imponująco i gęsto połączone, i tak wymyśliłoby wszystkie trzynaście połączeń. Narzędzie zoptymalizowane pod kątem zaufania odłącza ich od rzeczywistości i dokładnie zapisuje dlaczego oraz sugeruje dalsze aktualizacje schematu. Oto dziennik run dla drugiej grupy, prawdziwe rzeczy, na które schemat nie ma miejsca:
22:32:49 [INFO] mykg.steps.orphan_connect — Step orphan_connect — technology-qdrant: no edges confirmed; promoted to schema-gap orphan
22:32:49 [INFO] mykg.steps.orphan_connect — Step orphan_connect — technology-github-actions: no edges confirmed; promoted to schema-gap orphan
22:32:49 [INFO] mykg.steps.orphan_connect — Step orphan_connect — technology-weaviate: no edges confirmed; promoted to schema-gap orphan
Zwróć uwagę na etykietę: nie "odrzucony", nie "zignorowany", lecz flaga. Model nie tylko odmawia połączenia Alice Chen z MIT czy zespołu AI Research z PyTorch, ale także wskazuje, dlaczego nie może: schemat, który zatwierdziłeś w kroku 1, nie ma miejsca na taki rodzaj relacji. To coś innego niż twierdzenie, którego notatki nie potwierdzają. To twierdzenie, które notatki potwierdzają, że wykres obecnie nie ma uczciwego sposobu, by się utrzymać. I właśnie tę sytuację myKG oddaje ci do naprawy, nie wymuszając połączenie, ale uruchamiając aktualizację schematu, żeby następny przebieg miał uczciwe miejsce, gdzie go umieścić.**schema-gap orphan**
Efekt: zaufanie jako tarcza
Dodaj te cztery kroki i daje coś konkretnego: zaufanie to już nie jest wyrok tak lub nie, który wydajesz modelowi. To tarcza, a to ty ją trzymasz
Każdy uruchomienie generuje interaktywny plik z wbudowanymi suwakami pewności. Przeciągnij je, a wykres sam się przerysuje przed tobą. Na najniższym poziomie widzisz wszystko: wszystkie 44 węzły i 49 łączy (ten konkretny wykres jest na tyle czysty, że nic w nim nie ocenia poniżej ):knowledge_graph.html 0.80
Podnieś poziom do, a najsłabsze ogniwa zaczynają znikać, a graf kurczy się do swojego rdzenia:0.90
Przy wartości 0,9 i wyżej wykres spada do 33 widocznych łączy w 29 z oryginalnych 44 węzłów, a to, co znika, to dokładnie taki niepewny powód, którego chciałbyś zniknąć:
Carol Okafor -[reports_to]→ Dr. Priya Nairprzy 0,80 – relacja raportowa z poprzedniej pracy, nie obecnaAlice Chen -[contributes_to]→ Platform Secrets Serviceprzy 0,82, wkład, o którym notatki wspominają tylko luźnoRAG Pipeline -[uses_technology]→ Python0,82 – prawda, ale wspomniana tylko mimochodem
Na wyższym poziomie pozostaje solidne jądro: fakty jasno przedstawione i zarchiwizowane w wielu plikach, jak relacje z pracą i partnerami na i powyżej. Ale zwróć uwagę, czego trzymał się ten niższy poziom nauczania: stary tekst Carol Okafor, luźny wkład Alice Chen, przelotne użycie Pythona przez RAG Pipeline. Żadne z tych rozwiązań nie jest złe, po prostu są cieńsze niż kręgosłup. To dokładnie ten rodzaj rzeczy, które warto zobaczyć, gdy eksplorujesz korpus, którego jeszcze dobrze nie znasz, półzapomniane wspomnienie, które warto sprawdzić w notatkach źródłowych, nawet jeśli nie chciałbyś, by agent traktował to jako ustalony fakt. Nie ufasz wykresowi tylko dlatego, że ktoś ci to powiedział.0.95
Możesz wybrać własny próg zaufania w zależności od tego, co z nim robisz. Budujesz agenta, który odpowiada z solidnych podstaw? Ustaw podłogę i podaj tylko grzbiet, który właśnie widziałeś. Rozplanowanie, co faktycznie zawierają twoje notatki, włącznie z niedokończonymi sprawami? Pociągnij suwak z powrotem w dół i zobacz wszystko, co model znalazł, w tym słabe sygnały. Numer należy do Ciebie, a po prostu powiedz agentowi Claude'a przez komendę /myKG, jaki poziom pewności ma operować podczas odpowiadania na zapytania.0.9 0.0
Podsumowanie
Drugi mózg, któremu możesz zaufać, nie powstaje z jednego sprytnego testu czy dobrze wystrojonego promptu. Jest zbudowany z warstw, które wyłapują wzajemne błędy, i właśnie to daje myKG: owija LLM tymi warstwami, więc nie musisz ich tworzyć sam. W tym przebiegu każda warstwa spełniła swoje zadanie. Schemat został sprawdzony przed wyodrębnieniem czegokolwiek. Każdy element wykresu ma własny wskaźnik pewności. Kontrole strukturalne przeprowadzono bez pytania o opinię modelu. Model mógł swobodnie odrzucać niektóre twierdzenia zamiast wymyślać fałszywe powiązania.
To, co wnosi myKG, to to, co sprawia, że drugi mózg staje się czymś, na czym naprawdę można polegać.
Zbudowany z myKG. Przykład: pliki demo są tutaj.
Pełny projekt i zestaw funkcji narzędzia znajdziesz w artykule From Documents to a Living Knowledge Graph: Introducing myKG and the Github repozytorium.









