adewale/
skill-eval-harness
adewale/skill-eval-harnessHarnesses
Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters
73
Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters

Self-hosted AI agent harness in a single Go binary — writes, sandbox-tests and repairs its own tools, and lets Claude Code, Codex and any MCP client build and share them.
Playwright for coding agents. Benchmark Claude Code, Codex, Gemini, and OpenCode on your own tasks - and test that your skills, MCP servers, and CLIs work when an agent uses them. Sandboxed YAML suites, activation checks, A/B experiments, CI gates.