|
arxiv.org
|
📄 arXiv
|
|
arxiv.org
|
📄 PDF
|
|
github.com
|
💻 Code
|
|
arxiv.org
|
AnyTask: an Automated Task and Data Generation Framework for Advancing Sim-to-Real Policy Learning
|
|
arxiv.org
|
An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges
|
|
arxiv.org
|
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
|
|
arxiv.org
|
Sceniris: A Fast Procedural Scene Generation Framework
|
|
arxiv.org
|
Motus: A Unified Latent Action World Model
|
|
aas.net.cn
|
面向具身操作的视觉− 语言− 动作模型综述
|
|
heyumeng.com
|
ContinuousVLA: Regression-Based Alternatives to Action Bin Discretization
|
|
heyumeng.com
|
VLA-Regression-Based Alternatives to Action Bin Discretization
|
|
arxiv.org
|
Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy
|
|
arxiv.org
|
AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis
|
|
techrxiv.org
|
A Survey on Reinforcement Learning of Vision-Language-Action Models for Robotic Manipulation
|
|
heyumeng.com
|
VLA with better number representation
|
|
arxiv.org
|
Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach
|
|
arxiv.org
|
Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling
|
|
arxiv.org
|
PointNet4D: A Lightweight 4D Point Cloud Video Backbone for Online and Offline Perception in Robotic Applications
|
|
arxiv.org
|
CycleManip: Enabling Cyclic Task Manipulation via Effective Historical Perception and Understanding
|
|
arxiv.org
|
MM-ACT: Learn from Multimodal Parallel Generation to Act
|
|
arxiv.org
|
SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead
|
|
arxiv.org
|
Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention
|
|
arxiv.org
|
ε0: Enhancing Generalization and Fine-Grained Control in VLA Models via Continuized Discrete Diffusion
|
|
arxiv.org
|
GigaWorld-0: World Models as Data Engine to Empower Embodied AI
|
|
arxiv.org
|
Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories
|
|
arxiv.org
|
EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation
|
|
arxiv.org
|
InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy
|
|
arxiv.org
|
RoboTidy: A 3D Gaussian Splatting Household Tidying Benchmark for Embodied Navigation and Action
|
|
arxiv.org
|
Towards High-Consistency Embodied World Model with Multi-View Trajectory Videos
|
|
arxiv.org
|
A Study on Enhancing the Generalization Ability of Visuomotor Policies via Data Augmentation
|
|
arxiv.org
|
Decomposed Object Manipulation via Dual-Actor Policy
|
|
arxiv.org
|
Evo-1: Lightweight vision-language-action model with preserved semantic alignment
|
|
arxiv.org
|
ForeRobo: Unlocking Infinite Simulation Data for 3D Goal-driven Robotic Manipulation
|
|
techrxiv.org
|
Physical AI: Bridging the Sim-to-Real Divide Toward Embodied, Ethical, and Autonomous Intelligence
|
|
arxiv.org
|
Genie envisioner: A unified world foundation platform for robotic manipulation
|
|
arxiv.org
|
GenDexHand: Generative Simulation for Dexterous Hands
|
|
arxiv.org
|
GauDP: Reinventing Multi-Agent Collaboration through Gaussian-Image Synergy in Diffusion Policies
|
|
openaccess.thecvf.com
|
Diffusion-Based Imaginative Coordination for Bimanual Manipulation-Supplementary Material
|
|
arxiv.org
|
End-to-End Dexterous Arm-Hand VLA Policies via Shared Autonomy: VR Teleoperation Augmented by Autonomous Hand VLA Policy for Efficient Data Collection
|
|
arxiv.org
|
A Survey on Efficient Vision-Language-Action Models
|
|
arxiv.org
|
Dexbotic: Open-Source Vision-Language-Action Toolbox
|
|
mdpi.com
|
DT-Loong: A Digital Twin Simulation Framework for Scalable Data Collection and Training of Humanoid Robots
|
|
arxiv.org
|
FieldGen: From Teleoperated Pre-Manipulation Trajectories to Field-Guided Data Generation
|
|
arxiv.org
|
PathFormer: A Transformer with 3D Grid Constraints for Digital Twin Robot-Arm Trajectory Generation
|
|
arxiv.org
|
Imitation Learning Policy based on Multi-Step Consistent Integration Shortcut Model
|
|
arxiv.org
|
Robobench: A comprehensive evaluation benchmark for multimodal large language models as embodied brain
|
|
arxiv.org
|
RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies
|
|
arxiv.org
|
Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification
|
|
arxiv.org
|
VO-DP: Semantic-Geometric Adaptive Diffusion Policy for Vision-Only Robotic Manipulation
|
|
arxiv.org
|
Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
|
|
arxiv.org
|
Towards a Unified Understanding of Robot Manipulation: A Comprehensive Survey
|
|
arxiv.org
|
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
|
|
arxiv.org
|
OmniSAT: Compact Action Token, Faster Auto Regression
|
|
arxiv.org
|
FORGE-Tree: Diffusion-Forcing Tree Search for Long-Horizon Robot Manipulation
|
|
arxiv.org
|
MobRT: A Digital Twin-Based Framework for Scalable Learning in Mobile Manipulation
|
|
arxiv.org
|
FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models
|
|
arxiv.org
|
RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning
|
|
arxiv.org
|
Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach
|
|
arxiv.org
|
Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition
|
|
sciencedirect.com
|
Digital twin-empowered robotic arm manipulation with reinforcement learning: A comprehensive survey
|
|
arxiv.org
|
DexFlyWheel: A Scalable and Self-improving Data Generation Framework for Dexterous Manipulation
|
|
arxiv.org
|
Control Your Robot: A Unified System for Robot Control and Policy Deployment
|
|
arxiv.org
|
Liaohe-CobotMagic-PnP: an Imitation Learning Dataset of Intelligent Robot for Industrial Applications
|
|
arxiv.org
|
EgoDemoGen: Novel Egocentric Demonstration Generation Enables Viewpoint-Robust Manipulation
|
|
arxiv.org
|
EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer
|
|
onlinelibrary.wiley.com
|
Embodied AI: A Survey on the Evolution from Perceptive to Behavioral Intelligence
|
|
sciencedirect.com
|
A generalised system for multi-mobile robot cooperation in smart manufacturing
|
|
arxiv.org
|
Normalizing Flows are Capable Visuomotor Policy Learning Models
|
|
arxiv.org
|
D3Grasp: Diverse and Deformable Dexterous Grasping for General Objects
|
|
aas.net.cn
|
视觉–语言–动作模型综述: 从前史到前沿
|
|
arxiv.org
|
Improving Robotic Manipulation with Efficient Geometry-Aware Vision Encoder
|
|
arxiv.org
|
GP3: A 3D Geometry-Aware Policy with Multi-View Images for Robotic Manipulation
|
|
openreview.net
|
Reinventing Multi-Agent Collaboration through Gaussian-Image Synergy in Diffusion Policies
|
|
openreview.net
|
RoboMonster: Compositional Generalization of Heterogeneous Multi-End Effector Embodied Agents
|
|
arxiv.org
|
ManiVID-3D: Generalizable View-Invariant Reinforcement Learning for Robotic Manipulation via Disentangled 3D Representations
|
|
arxiv.org
|
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
|
|
arxiv.org
|
Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)
|
|
openreview.net
|
ROBOWHEEL: A HELICAL DATA ENGINE FROM REAL-WORLD HUMAN DEMONSTRATIONS FOR CROSS-DOMAIN ROBOTIC LEARNING
|
|
arxiv.org
|
Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
|
|
arxiv.org
|
ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training
|
|
sciencedirect.com
|
Agentic AI: The age of reasoning—A review
|
|
mdpi.com
|
Design and Development of Cost-Effective Humanoid Robots for Enhanced Human–Robot Interaction
|
|
arxiv.org
|
Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge
|
|
techrxiv.org
|
Recipe for Vision-Language-Action Models in Robotic Manipulation: A Survey
|
|
arxiv.org
|
GWM: Towards Scalable Gaussian World Models for Robotic Manipulation
|
|
arxiv.org
|
SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation
|
|
arxiv.org
|
Survey of Vision-Language-Action Models for Embodied Manipulation
|
|
github.com
|
Galaxea DP
|
|
techrxiv.org
|
Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications
|
|
arxiv.org
|
Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control
|
|
arxiv.org
|
HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents
|
|
arxiv.org
|
H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation
|
|
arxiv.org
|
DISCOVERSE: Efficient Robot Simulation in Complex High-Fidelity Environments
|
|
arxiv.org
|
ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents
|
|
arxiv.org
|
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
|
|
arxiv.org
|
AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation
|
|
arxiv.org
|
Diffusion-Based Imaginative Coordination for Bimanual Manipulation
|
|
researchgate.net
|
Linear Algebraic Properties Of Quantum Gates As A Starting Point For Their Digital Twinning
|
|
arxiv.org
|
EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling
|
|
arxiv.org
|
PRISM: Pointcloud Reintegrated Inference via Segmentation and Cross-attention for Manipulation
|