Jun 11, 2026, 10:46 AM
This commit is contained in:
@@ -0,0 +1,50 @@
|
||||
---
|
||||
title: "The 5 Core Mental Models for AI Agents: Harness & Memory (Deep Dive + Action Plan)"
|
||||
type: "summary"
|
||||
tags: [agent-ai, system-design, mental-models, memory-tiers, autonomy]
|
||||
created: 2026-06-09
|
||||
updated: 2026-06-09
|
||||
sources: ["raw/inbox/The 5 Core Mental Models for AI Agents_ Harness & Memory (Deep Dive + Action Plan) - BPMS Team.md"]
|
||||
confidence: high
|
||||
---
|
||||
|
||||
# The 5 Core Mental Models for AI Agents: Harness & Memory (Deep Dive + Action Plan)
|
||||
|
||||
Artykuł zespołu BPMS definiuje pięć fundamentalnych modeli mentalnych, które pozwalają inżynierom oprogramowania na przeniesienie agentów AI z fazy prostych prezentacji (demos) do stabilnych, produkcyjnych systemów biznesowych. Ramy te zostały zilustrowane na przykładzie budowy agenta do analizy oszustw (fraud analysis) z wykorzystaniem Gemini CLI i BigQuery.
|
||||
|
||||
## Key Points
|
||||
|
||||
### Model Mentalny 1 — Model to procesor (CPU). Rusztowanie (Harness) to system operacyjny (OS).
|
||||
- Sam model językowy (LLM) to tylko surowy silnik wnioskowania (jak procesor Intel/AMD). Poziom jakości i bezpieczeństwa aplikacji zależy całkowicie od **rusztowania (harness/scaffolding)**, które pełni rolę systemu operacyjnego.
|
||||
- "OS" definiuje wejścia/wyjścia, ograniczenia, bezpieczeństwo, cykle weryfikacji, checkpointy, wznawianie pracy (checkpoint/resume) oraz śledzenie kroków (run-level tracing). Zmiana rusztowania ma większy wpływ na wynik niż wymiana samego modelu na większy.
|
||||
- Wąski, rygorystyczny i dobrze oznaczony zestaw narzędzi (tools) jest zawsze lepszy niż przeładowany przybornik ze względu na minimalizację entropii decyzji modelu.
|
||||
|
||||
### Model Mentalny 2 — Kontekst jest Produktem (Context is the Product)
|
||||
- Zarządzanie **Stosem Kontekstu (Context Stack)** to kluczowy element inżynierii systemów agentowych. Na stos składają się: instrukcje systemowe, aktywne instrukcje projektu, historia konwersacji oraz pobrane wycinki z baz danych (RAG).
|
||||
- Istnieje stałe napięcie między chęcią dostarczenia modelowi maksymalnej liczby informacji (co marnuje tokeny i spowalnia czas reakcji) a zbyt wąskim zakresem, który prowadzi do halucynacji i błędów logicznych.
|
||||
|
||||
### Model Mentalny 3 — Oddziel Wykonawcę od Sędziego (Separate the Doer from the Judge)
|
||||
- Dla zachowania rzetelności procesów biznesowych należy bezwzględnie odseparować agenta wykonującego zadanie (**Doer**) od agenta weryfikującego jakość i zgodność z regułami (**Judge**).
|
||||
- Weryfikacja przebiega na spektrum: od automatycznych bram logicznych (kod deterministyczny, walidacja schematu JSON), przez sędziowanie za pomocą innego, mniejszego modelu LLM, aż po ostateczny nadzór człowieka (Human-in-the-Loop).
|
||||
|
||||
### Model Mentalny 4 — Pamięć to Trzy Poziomy Poznawcze, a nie jeden worek
|
||||
Systemy agentowe powinny rozróżniać i fizycznie separować pamięć na trzy warstwy:
|
||||
1. **Tier 1: Pamięć Krótkoterminowa / Robocza (Short-term / Working memory)**: Aktywny kontekst sesji czatu, lokalne zmienne i przejściowy stan operacyjny.
|
||||
2. **Tier 2: Pamięć Epizodyczna / Operacyjna (Episodic / Operational memory)**: Chronologiczny dziennik wykonanych akcji i zdarzeń (historyczny log sesji). Pozwala na odtworzenie ścieżki wnioskowania (run-level tracing).
|
||||
3. **Tier 3: Pamięć Długoterminowa / Semantyczna (Long-term / Semantic memory)**: Trwałe, utwardzone preferencje, reguły zachowania, przewodniki marki i wzorce bazodanowe (odpowiednik ustrukturyzowanych pamięci i plików kontraktów agenta).
|
||||
|
||||
### Model Mentalny 5 — Stopniowana Autonomia (Graduated Autonomy)
|
||||
- Zaufanie do agenta AI buduje się stopniowo poprzez weryfikację. Autonomia powinna być wdrażana etapowo na gradientowej skali:
|
||||
- *HITL (Human-in-the-Loop)*: Każda akcja modyfikująca system wymaga fizycznej zgody i kliknięcia człowieka.
|
||||
- *Human-on-the-Loop*: Agent wykonuje akcje autonomicznie, ale człowiek ma możliwość ich natychmiastowego cofnięcia (bramka czasowa / delay).
|
||||
- *Pełna autonomia*: Agent działa samodzielnie, raportując jedynie anomalie i błędy krytyczne do sędziego lub administratora.
|
||||
|
||||
## Relevant Concepts
|
||||
- [[concepts/model-as-cpu-harness-as-os]] — Architektura oddzielająca silnik wnioskowania od rusztowania operacyjnego.
|
||||
- [[concepts/context-stack-management]] — Strategie dynamicznego i oszczędnego zarządzania oknem kontekstowym.
|
||||
- [[concepts/doer-judge-split]] — Wzorzec projektowy zwiększający niezawodność poprzez separację ról wykonawczych i kontrolnych.
|
||||
- [[concepts/three-tier-memory]] — Trójwarstwowy model podziału pamięci agentów AI.
|
||||
- [[concepts/graduated-autonomy]] — Metody stopniowego zwiększania niezależności systemów autonomicznych.
|
||||
|
||||
## Sources
|
||||
- [[summaries/5-mental-models-for-ai-agents]]
|
||||
Reference in New Issue
Block a user