
Daily Paper Cast
2,319 episodes — Page 4 of 47
Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory
Aug 12, 202622 min
Motif 3: Technical Report
Aug 12, 202623 min
Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains
Aug 12, 202620 min
What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems
Aug 12, 202620 min
SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs
Aug 11, 202621 min
Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning
Aug 11, 202620 min
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving
Aug 11, 202621 min
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
Aug 8, 202621 min
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
Aug 8, 202619 min
Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval
Aug 8, 202622 min
WorldClaw: Agentic 3D Open-World Generation at Scale
Aug 8, 202621 min
GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?
Aug 8, 202619 min
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
Aug 8, 202619 min
ChronoVision: Temporal Reasoning via Latent State Reconstruction
Aug 8, 202619 min
Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval
Aug 8, 202620 min
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
Aug 7, 202620 min
ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
Aug 7, 202620 min
Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes
Aug 7, 202624 min
Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data
Aug 7, 202619 min
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations
Aug 6, 202621 min
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
Aug 6, 202620 min
AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling
Aug 6, 202620 min
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Aug 6, 202618 min
Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation
Aug 6, 202622 min
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
Aug 6, 202622 min
Quo Vadis, World Modeling?
Aug 6, 202620 min
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents
Aug 6, 202622 min
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models
Aug 6, 202622 min
SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
Aug 5, 202620 min
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
Aug 5, 202622 min
DAPD: Dual-Anchored Policy Distillation
Aug 5, 202620 min
Progressive Agent Skill Generation via Reinforcement Learning
Aug 5, 202621 min
VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
Aug 5, 202622 min
UEmbed: Unified Sparse and Dense Multimodal Embeddings
Aug 5, 202620 min
Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
Aug 5, 202621 min
CADENA: Stepwise CAD Reverse Engineering
Aug 5, 202623 min
WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
Aug 5, 202620 min
InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis
Aug 5, 202623 min
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
Aug 4, 202619 min
Mental World Modeling
Aug 4, 202621 min
$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
Aug 4, 202620 min
Meshy T2: Fast Native Mesh Generation with Flow Matching
Aug 4, 202621 min
Weak-to-Strong On-Policy Distillation
Aug 4, 202622 min
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
Aug 4, 202619 min
$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
Aug 4, 202622 min
Scaling Properties of Text Conditioning in Visual Generation
Aug 4, 202622 min
QQWorld: Quantile-Quantile Matching for World Model Regularization
Aug 4, 202620 min
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
Aug 1, 202619 min
Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents
Aug 1, 202623 min
Metis: Memory Foundation Model
Aug 1, 202618 min