Results for “conviction-scoring”
4 skillsMore results
c2c-eval
Benchmarks language model agents on the C2C multi-agent negotiation task, reporting win rate across starting positions.
3
eval
Evaluate and rank agent results by metric or LLM judge for an AgentHub session.
20.4k
evaluation
Build evaluation frameworks for agent systems with deterministic checks, regression suites, multi-dimensional rubrics, quality gates, production monitoring, and outcome measurement.
16.9k · bundle