PLAY PODCASTS
Daily Paper Cast

Daily Paper Cast

2,319 episodes — Page 4 of 47

Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memory

Aug 12, 202622 min

Motif 3: Technical Report

Aug 12, 202623 min

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Aug 12, 202620 min

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

Aug 12, 202620 min

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

Aug 11, 202621 min

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

Aug 11, 202620 min

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

Aug 11, 202621 min

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

Aug 8, 202621 min

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

Aug 8, 202619 min

Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrieval

Aug 8, 202622 min

WorldClaw: Agentic 3D Open-World Generation at Scale

Aug 8, 202621 min

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

Aug 8, 202619 min

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

Aug 8, 202619 min

ChronoVision: Temporal Reasoning via Latent State Reconstruction

Aug 8, 202619 min

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

Aug 8, 202620 min

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

Aug 7, 202620 min

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

Aug 7, 202620 min

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

Aug 7, 202624 min

Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Aug 7, 202619 min

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

Aug 6, 202621 min

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Aug 6, 202620 min

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

Aug 6, 202620 min

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Aug 6, 202618 min

Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation

Aug 6, 202622 min

PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

Aug 6, 202622 min

Quo Vadis, World Modeling?

Aug 6, 202620 min

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

Aug 6, 202622 min

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

Aug 6, 202622 min

SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

Aug 5, 202620 min

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Aug 5, 202622 min

DAPD: Dual-Anchored Policy Distillation

Aug 5, 202620 min

Progressive Agent Skill Generation via Reinforcement Learning

Aug 5, 202621 min

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

Aug 5, 202622 min

UEmbed: Unified Sparse and Dense Multimodal Embeddings

Aug 5, 202620 min

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

Aug 5, 202621 min

CADENA: Stepwise CAD Reverse Engineering

Aug 5, 202623 min

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

Aug 5, 202620 min

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

Aug 5, 202623 min

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

Aug 4, 202619 min

Mental World Modeling

Aug 4, 202621 min

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

Aug 4, 202620 min

Meshy T2: Fast Native Mesh Generation with Flow Matching

Aug 4, 202621 min

Weak-to-Strong On-Policy Distillation

Aug 4, 202622 min

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

Aug 4, 202619 min

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

Aug 4, 202622 min

Scaling Properties of Text Conditioning in Visual Generation

Aug 4, 202622 min

QQWorld: Quantile-Quantile Matching for World Model Regularization

Aug 4, 202620 min

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

Aug 1, 202619 min

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

Aug 1, 202623 min

Metis: Memory Foundation Model

Aug 1, 202618 min