Public results and task definitions for FrontierHarness Eval
frontier-harness-eval/
eval
frontier-harness-eval/evalHarnesses
183
adewale/
skill-eval-harness
adewale/skill-eval-harnessHarnesses
Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters
73
UiPath/coder_evalHarnesses
Playwright for coding agents. Benchmark Claude Code, Codex, Gemini, and OpenCode on your own tasks - and test that your skills, MCP servers, and CLIs work when an agent uses them. Sandboxed YAML suites, activation checks, A/B experiments, CI gates.
127
skillberry-ai/
cap-evolve
skillberry-ai/cap-evolveHarnesses
Optimize any AI agent’s skills, tools/MCP, and prompts against your own evals.
56
MadsLorentzen/ai-job-searchHarnesses
The job search that runs on your machine. AI job application framework built on Claude Code: evaluate postings, tailor CVs, write cover letters, prep interviews. Fork it and own it.
42k
greyhaven-ai/
autocontext
greyhaven-ai/autocontextHarnesses
a recursive self-improving harness designed to help your agents (and future iterations of those agents) succeed on any task
1.3k