ResearchAgentLAB First Benchmark for Long-Horizon Agent AttacksarXiv·high signalXBlueskyLinkedInCopy link5 novel attack types: intent hijacking, tool chaining, task injection, objective drifting, memory poisoning. 28 environments, 644 test cases.SourceSource pagearXiv↳ Follow the threadPolicy dependency / Stack layerPOLIS 5,280-Episode Study: Provenance-Aware Guards Block Authority Laundering That Local-State Guards Miss in 22 of 96 EpisodesarXiv 2608.09828Stack layer / Threat patternA survey of 21 open-source AI risk tools finds governance, legal, and financial controls almost entirely unaddressedarXivStack layer / ContrastActBench: Attack Success Against Cowork Agents Ranges 10.1%–94.4% Across Models but Only 73.7%–94.4% Across Harnesses — the Model Matters More Than the ScaffoldarXiv 2608.09476Stack layer / Update threadStepJack: splitting a prompt injection across three web pages nearly doubles the attack success rate on computer-use agentsarXiv (Borealis AI)Policy dependency / Stack layerRangeBench: 1,148 Multi-Hop Cyber Ranges Show Attack Agents Get a Foothold Then Stall — 24.5–47.0% Never Finish the ChainarXiv 2608.09526Policy dependency / Stack layerSplit your agent's safety into four evolvable artifacts — system prompt, rule bank, safety memory, tool policy — for a 3.1x attack-success reductionarXiv 2608.09885Policy dependency / Stack layerMARP treats multi-agent emergent behavior as a regulation target, learning a shared reward model from episode-level outcomesarXivStack layer / ContrastA poisoned agent can write its own future attack chain into a benign-looking artifact and waitarXiv 2608.06862