Entities · Locations
cs.CV
34 articles tagged with this entity.
-
Motion Attribution for Video Generation
-
Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning
-
RADIO1D: Elastic Representations for Condensed Vision Modeling
-
BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations
-
OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance
-
CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining
-
From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model
-
See the Emotion: A Facial Emoji Proxy Modeling for EEG Emotion Recognition
-
Moir\'e Video Authentication: A Physical Signature Against AI Video Generation
-
The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models
-
PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding
-
Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
-
Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models
-
Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
-
FlatLands: Generative Floormap Completion From a Single Egocentric View
-
PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking
-
RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning
-
HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers
-
HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
-
Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge
-
video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding
-
Latent Gaussian Splatting for 4D Panoptic Occupancy Tracking
-
Vero: An Open RL Recipe for General Visual Reasoning
-
Domain-Guided Prompting of the Segment Anything Model for Seismic Interpretation: The Role of Attributes, Visualization, and Hybrid Prompts
-
SP$^3$: Spherical Priors for Plug-and-Play Restoration
-
Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations
-
Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models
-
Diffusion Transformer World-Action Model for AV Scene Prediction
-
Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models
-
DD-INR: Dynamics-Driven Implicit Neural Representation for Accelerated Whole-Brain Functional MRI Reconstruction
-
VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents
-
Do Video Foundation Models Understand Intuitive Physics? A Layerwise Probing Analysis
-
Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?
-
AIDEN: Design and Pilot Study of an AI Assistant for the Visually Impaired