
kaizen
Kailash Kaizen - production-ready AI agent framework with signature-based programming, multi-agent c
Kaizen Framework Skills
27 skills for Kaizen AI agent framework covering core patterns, multi-agent coordination, multi-modal processing, autonomous tool calling, observability, memory systems, checkpoint/resume, and journey orchestration.
Skill Categories
Core Patterns (6 Skills - CRITICAL/HIGH)
Essential patterns for building Kaizen agents:
- kaizen-baseagent-quick.md - BaseAgent implementation, signature, config (3-step pattern)
- kaizen-signatures.md - InputField, OutputField, type-safe I/O, validation
- kaizen-config-patterns.md - Domain config vs BaseAgentConfig, auto-extraction
- kaizen-ux-helpers.md - extract_list/dict/float/str(), write_to_memory()
- kaizen-agent-execution.md - agent.run(), result handling, async execution
- kaizen-quickstart-template.md - Complete agent template (copy-paste ready)
Quick Start: Begin with kaizen-baseagent-quick.md → kaizen-signatures.md → kaizen-quickstart-template.md
Multi-Agent (5 Skills - HIGH)
Multi-agent coordination and Google A2A protocol:
- kaizen-multi-agent-setup.md - SharedMemoryPool, agent coordination infrastructure
- kaizen-shared-memory.md - write_to_memory(), read_relevant(), patterns
- kaizen-a2a-protocol.md - Automatic capability cards, semantic matching (100% Google A2A)
- kaizen-supervisor-worker.md - Supervisor-worker pattern, task delegation
- kaizen-agent-patterns.md - Consensus, debate, specialists, producer-consumer
Multi-Modal (4 Skills - HIGH)
Vision, audio, and multi-modal processing:
- kaizen-vision-processing.md - VisionAgent, OllamaVisionProvider, image analysis
- kaizen-audio-processing.md - Whisper, audio transcription
- kaizen-multimodal-orchestration.md - MultiModalAgent, vision+audio+text
- kaizen-multimodal-pitfalls.md - CRITICAL: Common mistakes (kaizen-specialist:301-373)
IMPORTANT: Read kaizen-multimodal-pitfalls.md FIRST to avoid common API mistakes
Journey Orchestration (1 Skill - HIGH) - NEW in v0.9.0
User journey management with declarative pathways and intent-driven transitions:
- kaizen-journey-orchestration.md - Journey, Pathway, Transitions, Context Accumulation, Nexus deployment
Key Features: Multi-pathway flows, intent detection (LLM-powered), ReturnToPrevious behavior, context accumulation with merge strategies, Nexus deployment
Advanced Patterns (11 Skills - MEDIUM/HIGH)
Production patterns, enterprise features, tool calling, observability, memory systems, and specialized techniques:
- kaizen-control-protocol.md - Bidirectional agent ↔ client communication
- kaizen-tool-calling.md - Autonomous tool execution with approval workflows
- kaizen-observability.md - Complete observability stack (tracing, metrics, logging, audit)
- kaizen-memory-system.md - Persistent memory, learning, and preference adaptation
- kaizen-checkpoint-resume.md - Automatic checkpointing and resume for long-running agents
- kaizen-chain-of-thought.md - CoT pattern, step-by-step reasoning
- kaizen-rag-agent.md - RAG implementation with Kaizen
- kaizen-react-pattern.md - ReAct (reasoning + acting)
- kaizen-cost-tracking.md - Token usage, budget management
- kaizen-streaming.md - Streaming responses, real-time output
- kaizen-testing-patterns.md - 3-tier testing, fixtures, standardized tests
Testing: All patterns use 3-tier strategy (Unit → Ollama → OpenAI), Real infrastructure recommended in Tiers 2-3
Learning Paths
Path 1: Basic Agent (15 minutes)
kaizen-baseagent-quick.md- Core patternkaizen-signatures.md- I/O definitionskaizen-quickstart-template.md- Copy template and run
Output: Working Q&A agent
Path 2: Production Agent (30 minutes)
kaizen-baseagent-quick.md- Core patternkaizen-config-patterns.md- Production configkaizen-ux-helpers.md- Defensive parsingkaizen-agent-execution.md- Error handlingkaizen-testing-patterns.md- 3-tier testing
Output: Production-ready agent with tests
Path 3: Multi-Agent System (45 minutes)
kaizen-baseagent-quick.md- Core patternkaizen-multi-agent-setup.md- Infrastructurekaizen-shared-memory.md- Coordinationkaizen-a2a-protocol.md- Semantic matchingkaizen-supervisor-worker.md- Task delegation
Output: Multi-agent system with semantic routing
Path 4: Multi-Modal Agent (30 minutes)
kaizen-baseagent-quick.md- Core patternkaizen-multimodal-pitfalls.md- READ FIRST!kaizen-vision-processing.md- Image analysiskaizen-audio-processing.md- Audio transcriptionkaizen-multimodal-orchestration.md- Unified processing
Output: Vision + audio agent
Path 5: User Journey Orchestration (45 minutes) - NEW
kaizen-baseagent-quick.md- Core patternkaizen-signatures.md- Signatures with__intent__,__guidelines__kaizen-journey-orchestration.md- Journey, Pathway, Transitionsexamples/journey/healthcare_referral/- Reference implementation
Output: Multi-pathway user journey with intent-driven transitions
Critical References
Quick References
- Specialist Agent:
.claude/agents/frameworks/kaizen-specialist.md(comprehensive reference table) - Examples: the Kaizen examples (35+ working examples)
Key Content Sources
- Multi-Modal Pitfalls: kaizen-specialist.md lines 301-373 (CRITICAL)
- A2A Protocol: kaizen-specialist.md lines 115-165
- UX Improvements: kaizen-specialist.md lines 249-298
- Quickstart Template: kaizen-specialist.md lines 489-520
- Test Fixtures:
tests/conftest.py
Critical Patterns
BaseAgent Pattern (Most Common)
from kaizen.core.base_agent import BaseAgent
from kaizen.signatures import Signature, InputField, OutputField
from dataclasses import dataclass
@dataclass
class MyConfig:
llm_provider: str = os.environ.get("LLM_PROVIDER", "openai")
model: str = os.environ.get("LLM_MODEL", "")
temperature: float = 0.7
class MySignature(Signature):
question: str = InputField(description="User question")
answer: str = OutputField(description="Answer")
class MyAgent(BaseAgent):
def __init__(self, config: MyConfig):
super().__init__(config=config, signature=MySignature())
def ask(self, question: str) -> dict:
return self.run(question=question)
Multi-Agent Pattern
from kaizen.memory.shared_memory import SharedMemoryPool
shared_pool = SharedMemoryPool()
agent1 = ResearcherAgent(config, shared_pool, agent_id="researcher")
agent2 = AnalystAgent(config, shared_pool, agent_id="analyst")
findings = agent1.research("AI trends")
analysis = agent2.analyze(findings)
Vision Pattern (Watch for Pitfalls!)
from kaizen_agents.agents import VisionAgent, VisionAgentConfig
config = VisionAgentConfig(llm_provider="ollama", model="bakllava")
agent = VisionAgent(config=config)
result = agent.analyze(
image="/path/to/image.png", # File path, NOT base64
question="What is this?" # 'question', NOT 'prompt'
)
print(result['answer']) # Key is 'answer', NOT 'response'
Framework Status (v0.9.0)
Implementation: Production-ready Performance: -0.06% overhead (essentially zero), validated with real LLM workloads Observability: Complete stack (tracing, metrics, logging, audit) with Grafana/Prometheus/Jaeger/ELK Multi-Modal: Vision (Ollama + OpenAI) + Audio (Whisper) fully operational Multi-Agent: SupervisorWorkerPattern production-ready A2A Protocol: 100% Google A2A compliant with automatic capability cards Journey Orchestration: Layer 5 with declarative pathways, intent detection, context accumulation (351 tests)
CRITICAL RULES
ALWAYS:
- ✅ Use domain configs (e.g.,
QAConfig), let BaseAgent auto-convert - ✅ Call
self.run(), notstrategy.execute() - ✅ Load
.envwithload_dotenv()before creating agents - ✅ Use extract_*() for result parsing
- ✅ Read
kaizen-multimodal-pitfalls.mdbefore using vision/audio
NEVER:
- ❌ Create BaseAgentConfig manually (use auto-conversion)
- ❌ Use 'prompt' parameter with VisionAgent (use 'question')
- ❌ Pass base64 strings to Ollama (use file paths)
- ❌ Access 'response' key from VisionAgent (use 'answer')
- ❌ Skip real infrastructure testing (Real infrastructure recommended in Tiers 2-3)
Quick References by Task
| Task | Skills |
|---|---|
| Create basic agent | baseagent-quick, signatures, quickstart-template |
| Production agent | config-patterns, ux-helpers, agent-execution, testing-patterns |
| Production monitoring | observability (v0.5.0) - tracing, metrics, logging, audit |
| Interactive agents | control-protocol (v0.2.0), baseagent-quick |
| Tool calling | tool-calling (v0.2.0), control-protocol |
| Multi-agent system | multi-agent-setup, shared-memory, a2a-protocol, supervisor-worker |
| User journeys | journey-orchestration (v0.9.0) - pathways, intent detection, context |
| Vision processing | multimodal-pitfalls (READ FIRST), vision-processing |
| Audio processing | audio-processing, multimodal-orchestration |
| Chain of thought | chain-of-thought |
| RAG implementation | rag-agent |
| Cost management | cost-tracking |
| Streaming | streaming |
Next Steps: Start with kaizen-baseagent-quick.md for core pattern, then choose a learning path based on your needs.