Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
Secondo ArXiv: Argus è un runtime agentico con ruoli separati (Manager, Planner, Engineer, Reviewer) che dichiara circa il 78% su SWE-Bench Pro contro il 59% di un Copilot diretto, usando però 1,41 volte i token. Il numero interessante non è l'accuracy, è il costo per task risolto: quasi venti punti in più pagati con il 41% di token aggiuntivi vanno letti a bolletta, non a slide. La parte che guarderei davvero è la verifica — i pesi restano fissi, l'evoluzione sta nello stato persistente e nelle policy di controllo, ed è lì che si vede se regge fuori dai benchmark.
