전체 글(274)
-
GEN-1.5: Embodied Foundation Models are One-Shot Learners
GEN-1.5: Embodied Foundation Models are One-Shot Learners GeneralistAI 인간은 단 한두 가지 예시만으로도 새로운 신체 기술을 놀라울 정도로 잘 수행할 수 있습니다. 우리의 최신 로봇 파운데이션 모델인 GEN-1.5는 바로 그 능력의 시작을 보여줍니다: 그래디언트 업데이트나 파인튜닝 없이도 단일 예시만으로 몇 초 만에 새로운 작업을 학습할 수 있습니다. 이 모델은 데모를 통한 원샷 및 퓨샷 학습뿐만 아니라 제로샷 물리 일반화에서도 폭넓은 성능을 보여줍니다. 과제들이 단순하고 단기간에 끝나는 것임에도 불구하고, 물리적 기술에 대해 원샷 및 퓨샷 학습이 대규모로 구현된 첫 번째 모델입니다. 우리는 이 결과를 물리적 세계를 위한 범용 지능 구축이라는 우리의..
2026.08.31 -
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization Tsinghua University, UESTC, Shanghai Jiao Tong University AbstractVision-Language-Action (VLA) 모델은 비전과 언어 구성 요소가 가진 풍부한 암묵적 지식에 힘입어 놀라운 성과를 보여주었습니다. 하지만 범용 로봇 에이전트를 구현하려면 물리적 상호작용에 대한 정확한 이해가 필요하며, 특히 미세한 힘 제어가 필수적인 접촉이 많은 상황에서 더욱 그렇습니다. 우리는 VLA의 암묵적 지식을 단순히 무엇을 해야 하는지 파악하는 수준을 넘어, 실제 세계와 물리적으로 상호..
2026.08.24 -
Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation
Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation Shanghai AI Labaoratory, The University of Hong Kong, Zhejiang University, Tsinghua University Abstract최근 대규모 vision-language models (VLM)은 vision-language navigation (VLN)의 일반화를 개선했지만, 기존 방법은 일반적으로 비전-언어 입력을 단거리 이산 액션에 직접 매핑하는 종단 간 파이프라인에 의존합니다. 이러한 설계는 종종 파편화된 액션을 생성하고, 높은 latency를 초래하며, 동적 ..
2026.06.25 -
Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System [Blog]
Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System QwenTeam 에이전트 내비게이션 시스템에는 구성 가능한 내비게이션 컨텍스트 프로토콜을 갖춘 base 내비게이션 모델이 필요합니다: 명령 추적, 객체 검색, 목표 추적, 자율 주행은 동일한 인식-플래닝 백본을 공유하지만 시각적 스트림을 소비하기 위한 근본적으로 다른 맥락 전략을 요구합니다.LLM 도구 사용을 위한 모델 컨텍스트 프로토콜과 마찬가지로, 내비게이션 모델도 추론 시 이러한 다양한 컨텍스트 요구 사항을 관리하기 위해 표준화된 인터페이스가 필요합니다.Qwen-RobotNav는 Qwen3-VL을 기반으로 구축된 확장 가능한 내비게이션 모델로, 두 ..
2026.06.22 -
NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance
NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance Shanghai AI Lab, Tsinghua University, Zhejiang University, The University of Hong Kong Abstract역동적이고 복잡한 오픈 월드 환경에서 내비게이션을 학습하는 것은 자율 로봇에게 매우 중요하지만 도전적인 능력입니다.기존 접근 방식은 종종 계단식 모듈러 프레임워크에 의존하며, 이는 제한된 실제 데모 데이터로부터 광범위한 하이퍼파라미터 튜닝이나 학습을 필요로 합니다.이 논문에서는 다양한 환경과 로봇 embodiments에 걸쳐 제로샷 시뮬레이션에서 실제 전송을 가능하게 하는 ..
2026.06.10 -
An Efficient and Multi-Modal Navigation System with One-Step World Model
An Efficient and Multi-Modal Navigation System with One-Step World Model Tsinghua University, Xiaomi One-Step World Model Navigation — 느린 월드 모델을 실시간으로 끌어올린 트릭한 줄 요약: "액션을 머릿속으로 상상해보고 제일 나은 걸 고르는" 월드 모델 내비게이션은 아이디어는 좋은데 너무 느려서 실제 로봇엔 못 썼다. 이 논문은 생성을 한 방에 끝내는 트릭으로 이걸 실시간급으로 만들고, 이미지·언어·포인트 목표를 하나의 프레임워크로 묶는다.1. 무슨 문제를 푸는가월드 모델 기반 내비게이션의 핵심 아이디어는 이렇다. 로봇이 "이 액션을 하면 다음에 뭐가 보일까?"를 미리 그려보고(= 미래 관측 예측)..
2026.06.10