adewale/
skill-eval-harness
adewale/skill-eval-harnessHarnesses
Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters
73
Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters
A practical, no-hype workflow for AI coding agents: context, plan, implement, review, QA, ship, retro. Templates, two Claude Code skills, and a 40% context rule - every claim traced to official docs.
AI-native agent harness for coding workflows by python: multi-model LLM orchestration, stateful sessions, tool governance, traceable delivery, and provider routing for GPT, Claude, DeepSeek, Qwen, Kimi, GLM, and MiniMax.
Observability and enforcement for AI agent harnesses. Capture every run and runtime reliability with policy enforcement. 40 built-in policies, a local dashboard, no account required with a generous free cloud plan