What’s Happening in My Field
Reasoning
SiLR: Structure-Preserving Admission and Process Reward for LLM Tool Agents
2026-09-04
Audio ReasoningTracing Audio Grounding and Answer Selection in Audio LLMs
2026-09-04
Flow MatchingFlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
2026-09-03
MultimodalRevisiting Topological Graphs for Macro Action based Closed-loop Reinforcement Learning of Vision Language Navigation in Continuous Environment
2026-09-03
Self-ImprovementLLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails
2026-09-02
ReasoningCliff: Learning Process Rewards from the First Mistake
2026-09-02
ReasoningA Survey on Self-Improving Test-Time Intelligence: Feedback-Driven Adapting, Learning, and Scaling at Inference
2026-09-01
RL TrainingHarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution
2026-09-01
Self-ImprovementDoes On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement
2026-08-31