
Daily Paper Cast
2,319 episodes — Page 5 of 47
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
Aug 1, 202621 min
PhiZero: A World Model Built Around Physical Language
Aug 1, 202619 min
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
Aug 1, 202622 min
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
Aug 1, 202622 min
Beacon: Knowing When and How to Perform Agentic Visual Reasoning
Aug 1, 202620 min
BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
Aug 1, 202620 min
Flux-OPD: On-Policy Distillation with Evolving Contexts
Aug 1, 202620 min
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
Jul 31, 202620 min
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
Jul 31, 202620 min
HumanCLAW: Can Vision-Language Models Act Through a Body?
Jul 31, 202619 min
DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space
Jul 31, 202619 min
CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition
Jul 31, 202621 min
CAST: Game Solvers as Turn-Level Teachers for LLM Agents
Jul 31, 202620 min
HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone
Jul 30, 202619 min
A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
Jul 30, 202619 min
CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents
Jul 30, 202619 min
ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition
Jul 30, 202621 min
Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
Jul 30, 202619 min
Pass the Baton: Trajectory-Relayed On-Policy Distillation
Jul 30, 202620 min
Kimi K3: Open Frontier Intelligence
Jul 29, 202620 min
JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
Jul 29, 202620 min
Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
Jul 29, 202621 min
From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
Jul 29, 202620 min
Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
Jul 29, 202621 min
StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Jul 29, 202621 min
Data Pyramid for Embodied Manipulation
Jul 29, 202623 min
Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
Jul 29, 202622 min
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
Jul 29, 202620 min
Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Jul 29, 202623 min
DataPrep-Bench: Benchmarking LLMs as Training Data Preparators
Jul 28, 202621 min
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
Jul 28, 202619 min
Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning
Jul 28, 202619 min
AREX: Towards a Recursively Self-Improving Agent for Deep Research
Jul 25, 202619 min
ReferTrack: Referring Then Tracking for Embodied Visual Tracking
Jul 25, 202620 min
K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
Jul 25, 202622 min
Visual Contrastive Self-Distillation
Jul 25, 202621 min
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
Jul 25, 202620 min
SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
Jul 24, 202619 min
ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
Jul 23, 202621 min
DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
Jul 23, 202619 min
Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers
Jul 23, 202622 min
Generative World Renderer at the Speed of Play
Jul 23, 202619 min
Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Jul 23, 202620 min
AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report
Jul 23, 202621 min
AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
Jul 23, 202621 min
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
Jul 22, 202617 min
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
Jul 22, 202619 min
EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World
Jul 22, 202620 min
SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
Jul 22, 202619 min
RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
Jul 22, 202622 min