ResearchRubric-Supervised Critic Plus 15.9 SWE-bench 83 Percent Fewer AttemptsarXiv·high signalXBlueskyLinkedInCopy link24 behavioral rubrics from human-agent traces. Semi-supervised critic enables efficient coding agent training with early stopping.SourceSource pagearXiv↳ Follow the threadStack layer / Threat patternVibe Coding Cut Task Time 27% and Raised Security Vulnerabilities in the Same TrialarXiv 2609.09560Stack layer / Threat pattern16% of 3,171 public agent-harness setups carry a confirmed security defect, and 3.8% ship a skill that pre-approves your shellarXivStack layer / Update threadPrivEscalate Scales Linux Privilege-Escalation Evaluation From Under 15 Scenarios to 531 Dockerized OnesarXiv 2609.09087Stack layer / Follow-up threadModels Spot Only 9.6% of Implementation Gaps in Research Specs but Fix 80.6% Once You Point Them OutarXiv 2609.10539Policy dependency / Stack layerMemSentry gates persistent memory writes on a signed security-state delta rather than on content classificationarXivStack layerTraining-Free Task Vectors Turn Activation Steering Into Rank-One Weight Edits Using Only Forward PassesarXiv 2609.09054Threat patternIntentest externalizes long-horizon pentest state onto a fact-intent DAG to stop agents loopingarXivStack layerMiles v0.1 Runs Fully Asynchronous Agentic RL on a 744B GLM-5.2 at 263 Seconds Per SteparXiv 2609.08368