Framework open source (Apache-2.0) di UiPath per valutare e benchmarkare agenti di coding e le loro skill: task dichiarativi in YAML eseguiti in sandbox contro Claude Code, Codex o Antigravity, scoring pesato 0.0–1.0, esperimenti A/B e gate CI con GitHub Action.
Repo e link preferiti
Repository e tutorial selezionati a mano che meritano il tuo tempo — cosa sono e perché contano.
Layer di orchestrazione multi-modello per Claude Code, open source (MIT): il modello di frontiera pianifica nella sessione principale, Sonnet e Haiku eseguono il lavoro di volume via subagent globali e verifier Opus a contesto fresco proteggono la qualità — tre file di configurazione, zero codice runtime.
Suite Office open source pensata per gli agenti AI: un binario singolo (niente Office installato) che crea, legge e modifica Word, Excel e PowerPoint da riga di comando, con rendering HTML/PNG integrato, motore formule Excel, template merge e server MCP.
Dashboard local-first che mostra cosa hanno fatto davvero i coding agent e quanto è costato: legge i log di sessione che Claude Code e Codex già scrivono in locale, li incrocia con il lavoro registrato via MCP e presenta token, costi stimati, task ed evidenze — tutto su 127.0.0.1, senza account, cloud o telemetria.
Il coding agent da terminale di xAI, ora open source (Apache 2.0): un harness in Rust con TUI fullscreen che legge il codebase, modifica file, esegue comandi e si estende con skill, plugin, hook, server MCP e subagent — in interattivo, headless per CI o dentro gli editor via Agent Client Protocol.
Uno strumento a riga di comando in Python che trasforma siti di documentazione, repository GitHub e PDF in Skill pronte per Claude (e per altri LLM), con rilevamento automatico delle discrepanze fra la documentazione e il codice reale: in tre comandi porti la conoscenza aggiornata di una libreria dentro una Skill.
Uno strumento che dà a Claude Code (e a qualunque agente) un vero browser da pilotare con script Playwright eseguiti in una sandbox QuickJS WASM: pagine che restano vive fra uno script e l'altro, connessione al Chrome già aperto o a un Chromium nuovo, e due livelli di controllo — a pixel e per id del DOM.
Una distillazione della community di come Claude Fable 5 affrontava i problemi, impacchettata come skill che ogni modello può seguire: classifica la richiesta, definisci cosa vuol dire «fatto» con una verifica esplicita, raccogli evidenze, decidi, applica la modifica minima, verifica per osservazione e riporta l'esito con onestà. Tre parole: think, act, prove.
Assistente AI per riunioni che cattura, trascrive e riassume gli incontri interamente sul dispositivo: Whisper o Parakeet per la trascrizione, Ollama (o un modello a scelta) per i riassunti, con zero audio inviato al cloud.
Auditor di codice autonomo che orchestra Claude (e opzionalmente Gemini) per analizzare un codebase, tracciare il data-flow e scrivere un proof-of-concept funzionante per ogni vulnerabilità confermata — senza chiave API.
Plugin ufficiale che porta il metodo Compound Engineering — strategia, brainstorm, piano, lavoro, review, nota di apprendimento — su Claude Code, Codex, Cursor e altri sei agenti.
Design system React open source nato in otto anni dentro Meta (13.000+ app interne): oltre 90 componenti, StyleX come motore di stile e un CLI con manifest JSON pensato per essere letto anche dagli agenti di coding.
CLI in Go che avvia Claude Code o Codex dentro una VM Linux usa-e-getta: repo montato, root nel guest, rete in allow-list — mentre file, chiavi e keychain dell'host restano fuori portata.
Hook in Rust che intercetta i comandi shell degli agenti AI e blocca quelli distruttivi — rm -rf, git reset --hard, DROP TABLE — prima che vengano eseguiti, con spiegazione e alternative sicure.
Framework di skill componibili che dà agli agenti di coding una metodologia completa — brainstorming, piano, TDD, review — con trigger automatici su Claude Code, Codex, Cursor e altri harness.
Proxy locale che traduce l'API di Codex verso qualsiasi provider: Claude, Gemini, DeepSeek, Kimi o un modello locale via Ollama, dentro Codex CLI/App/SDK e perfino Claude Code.
Everything Claude Code (ECC): un layer open source di skill, instincts, memoria persistente, hook e security scanning che potenzia Claude Code, Codex, Cursor e gli altri harness — oltre 211k stelle.
Un framework open source multi-agente che trasforma l'agente AI che già usi — Claude Code, Codex o un modello locale — in un red team autonomo: recon, exploit e report su target autorizzati, da una «War Room» nel browser o da CLI.
Un plugin MCP che dà a Claude Code e agli altri agenti la ricerca semantica sull'intero codebase: indicizza il progetto in un database vettoriale e restituisce solo gli snippet rilevanti, invece di caricare interi file a ogni richiesta.
Un pacchetto Python che dà accesso programmatico a Google NotebookLM: una CLI (nlm) e un server MCP con una quarantina di strumenti per creare notebook, aggiungere fonti e generare podcast, video, mappe mentali e riassunti da terminale o da un agente AI.
Alternativa open source a Semrush e Ahrefs: una suite SEO self-hosted (Docker o Cloudflare) per keyword, rank tracking, backlink e audit, che espone un server MCP e delle skill così un agente AI lavora direttamente sui dati SEO.
Toolkit open source di GitHub per lo spec-driven development: la CLI specify trasforma una specifica in piano e task eseguibili dagli agenti AI (Claude Code, Copilot, Gemini, Codex) invece di partire dal prompt.
Strumento che scopre servizi di AI esposti in rete: mappa endpoint di modelli e servizi LLM raggiungibili, pensato per red team e assessment di sicurezza.
Workspace open-source (ex MindsDB, oggi MindsHub Cowork) dove deleghi interi task — ricerca, report, operazioni schedulate — ad agenti che si connettono ai tuoi dati e restituiscono artefatti pubblicabili.
Workflow di sviluppo pronti alla produzione per Claude Code, guidati da agenti AI specializzati per qualità del codice e automazione.
Utility Python che converte PDF, Office, immagini e audio in Markdown pulito, pensata per le pipeline LLM.
Agente di cybersecurity autonomo: unisce un LLM self-hosted (Ollama), una sandbox Docker in stile Kali Linux e una TUI per automatizzare recon e bug bounty, senza API key né cloud.
Server MCP open source e locale che mappa il piano di esecuzione di un agente di coding (Claude Code, Codex, Cursor…) come flowchart interattivo prima che scriva codice.
Skill per assistenti di coding (Claude Code, Codex, Gemini CLI…) che trasforma una cartella di codice, schemi SQL, script e documenti in un knowledge graph interrogabile — senza inviare il codice a nessuno.
Indice gerarchico dei documenti per un RAG 'vectorless': invece di embedding e ricerca per similarità, l'LLM naviga una struttura ad albero ragionando su quale sezione aprire.
Un comando per scoprire quali modelli (fra centinaia, con vari provider) girano sull'hardware che hai: valuta RAM, VRAM e formato per dirti cosa è realistico eseguire in locale.
Configurazione ottimizzata di un server Ollama per Mac Studio e altri Mac Apple Silicon: setup headless, avvio automatico, tuning delle risorse e gestione remota via SSH.
Tutorial passo-passo per costruire il primo agente AI in C# con il Microsoft Agent Framework.
Come esporre agenti AI dietro una Web API .NET con il Microsoft Agent Framework.
Costruire un centro operativo AI di livello produttivo in C# .NET unendo AG-UI e il Microsoft Agent Framework.
Un sistema RAG end-to-end in .NET 8 con embedding OpenAI e vector database Qdrant.
Uno stack RAG completo in .NET 8: Azure Functions, Qdrant, grafo Neo4j e modelli Hugging Face.
La panoramica ufficiale del Microsoft Agent Framework: concetti, componenti e modello di programmazione.
L'annuncio ufficiale sul .NET Blog del Microsoft Agent Framework in preview e delle sue motivazioni.
Tutorial ufficiale: RAG e vector search in .NET usando OpenAI e Azure Cosmos DB for MongoDB.
Guida MongoDB per integrare Semantic Kernel in C# con Atlas Vector Search.