Vai al contenuto

UiPath/coder_eval

di UiPath

Anteprima di UiPath/coder_eval

Stack:PythonClaude CodeDockerTypeScript

Framework open source (Apache-2.0) di UiPath per valutare e benchmarkare agenti di coding e le loro skill: task dichiarativi in YAML eseguiti in sandbox contro Claude Code, Codex o Antigravity, scoring pesato 0.0–1.0, esperimenti A/B e gate CI con GitHub Action.

Perché è interessante

L'ho scelto perché risponde alla domanda che nessuno si fa dopo aver scritto una skill o un MCP server: «scatta davvero?». Il criterio `skill_triggered` legge le trace dell'agente e ti restituisce una matrice di confusione con precision e recall — smetti di giudicare a occhio e inizi a misurare.

#evaluation#benchmark#claude-code#ci#agent-testing#skills