PLAY PODCASTS
Daily Paper Cast

Daily Paper Cast

2,319 episodes — Page 7 of 47

Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling

Jul 9, 202620 min

Vision as Unified Multimodal Generation

Jul 9, 202626 min

Gemma 4 Technical Report

Jul 9, 202623 min

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

Jul 8, 202620 min

UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

Jul 8, 202621 min

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

Jul 8, 202623 min

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

Jul 8, 202623 min

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

Jul 8, 202627 min

MANCE: Manifold Aware Concept Erasure

Jul 8, 202622 min

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

Jul 8, 202625 min

Wan-Streamer v0.2: Higher Resolution, Same Latency

Jul 8, 202621 min

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

Jul 8, 202622 min

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

Jul 7, 202621 min

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Jul 7, 202622 min

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

Jul 7, 202623 min

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

Jul 7, 202620 min

DataComp-VLM: Improved Open Datasets for Vision-Language Models

Jul 7, 202622 min

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

Jul 4, 202624 min

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

Jul 4, 202623 min

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

Jul 4, 202623 min

Morphing into Hybrid Attention Models

Jul 4, 202624 min

AgenticDataBench: A Comprehensive Benchmark for Data Agents

Jul 4, 202621 min

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

Jul 4, 202622 min

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

Jul 3, 202621 min

Orca: The World is in Your Mind

Jul 2, 202624 min

Dockerless: Environment-Free Program Verifier for Coding Agents

Jul 2, 202624 min

DOPD: Dual On-policy Distillation

Jul 2, 202625 min

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

Jul 2, 202621 min

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

Jul 2, 202623 min

GEAR: Guided End-to-End AutoRegression for Image Synthesis

Jul 2, 202626 min

Multi-Block Diffusion Language Models

Jul 2, 202623 min

Agentic Abstention: Do Agents Know When to Stop Instead of Act?

Jul 1, 202624 min

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

Jul 1, 202623 min

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

Jul 1, 202626 min

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

Jul 1, 202622 min

Beyond IID: How General Are Tabular Foundation Models, Really?

Jul 1, 202622 min

Trimming the Long-Tail of Visual World Modeling Evaluation

Jul 1, 202625 min

AsyncOPD: How Stale Can On-Policy Distillation Be?

Jul 1, 202622 min

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Jul 1, 202620 min

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

Jul 1, 202622 min

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

Jun 30, 202621 min

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

Jun 30, 202623 min

Qwen-Image-2.0-RL Technical Report

Jun 30, 202627 min

DanceOPD: On-Policy Generative Field Distillation

Jun 28, 202625 min

In-Context World Modeling for Robotic Control

Jun 28, 202623 min

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

Jun 28, 202621 min

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

Jun 28, 202623 min

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

Jun 28, 202622 min

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

Jun 28, 202625 min

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

Jun 28, 202620 min