Agent-G^2: Gaussian Guidance for Agentic Reinforcement Learning Paper • 2608.23318 • Published 13 days ago • 32
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces Paper • 2608.23041 • Published 13 days ago • 64
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection Paper • 2608.20169 • Published 13 days ago • 11
Granite 4.2 Language Models Collection Efficient reasoning and thinking language models for multilingual generation, coding, and AI assistant workflows. • 3 items • Updated 11 days ago • 37
Apodex 1.1: Scaling Agentic Intelligence for Complex Work Paper • 2608.23283 • Published 13 days ago • 205
AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale Paper • 2608.20634 • Published 16 days ago • 12
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use Paper • 2608.20202 • Published 17 days ago • 34
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL Paper • 2608.17253 • Published 18 days ago • 97
FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving Paper • 2608.19758 • Published 17 days ago • 20
Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization Paper • 2608.16072 • Published 20 days ago • 151
Improving the matrix multiplication exponent with modern optimization and AlphaEvolve Paper • 2608.16884 • Published 20 days ago • 19