PLAY PODCASTS
Daily Paper Cast

Daily Paper Cast

2,319 episodes — Page 5 of 47

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Aug 1, 202621 min

PhiZero: A World Model Built Around Physical Language

Aug 1, 202619 min

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

Aug 1, 202622 min

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory

Aug 1, 202622 min

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Aug 1, 202620 min

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

Aug 1, 202620 min

Flux-OPD: On-Policy Distillation with Evolving Contexts

Aug 1, 202620 min

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Jul 31, 202620 min

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

Jul 31, 202620 min

HumanCLAW: Can Vision-Language Models Act Through a Body?

Jul 31, 202619 min

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

Jul 31, 202619 min

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

Jul 31, 202621 min

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

Jul 31, 202620 min

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

Jul 30, 202619 min

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

Jul 30, 202619 min

CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

Jul 30, 202619 min

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

Jul 30, 202621 min

Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

Jul 30, 202619 min

Pass the Baton: Trajectory-Relayed On-Policy Distillation

Jul 30, 202620 min

Kimi K3: Open Frontier Intelligence

Jul 29, 202620 min

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

Jul 29, 202620 min

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

Jul 29, 202621 min

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

Jul 29, 202620 min

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

Jul 29, 202621 min

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

Jul 29, 202621 min

Data Pyramid for Embodied Manipulation

Jul 29, 202623 min

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Jul 29, 202622 min

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

Jul 29, 202620 min

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Jul 29, 202623 min

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

Jul 28, 202621 min

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

Jul 28, 202619 min

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Jul 28, 202619 min

AREX: Towards a Recursively Self-Improving Agent for Deep Research

Jul 25, 202619 min

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

Jul 25, 202620 min

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs

Jul 25, 202622 min

Visual Contrastive Self-Distillation

Jul 25, 202621 min

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

Jul 25, 202620 min

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

Jul 24, 202619 min

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

Jul 23, 202621 min

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

Jul 23, 202619 min

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

Jul 23, 202622 min

Generative World Renderer at the Speed of Play

Jul 23, 202619 min

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Jul 23, 202620 min

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

Jul 23, 202621 min

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents

Jul 23, 202621 min

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

Jul 22, 202617 min

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

Jul 22, 202619 min

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

Jul 22, 202620 min

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

Jul 22, 202619 min

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

Jul 22, 202622 min