전체 글(271)
-
Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation
Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation Shanghai AI Labaoratory, The University of Hong Kong, Zhejiang University, Tsinghua University Abstract최근 대규모 vision-language models (VLM)은 vision-language navigation (VLN)의 일반화를 개선했지만, 기존 방법은 일반적으로 비전-언어 입력을 단거리 이산 액션에 직접 매핑하는 종단 간 파이프라인에 의존합니다. 이러한 설계는 종종 파편화된 액션을 생성하고, 높은 latency를 초래하며, 동적 ..
2026.06.25 -
Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System [Blog]
Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System QwenTeam 에이전트 내비게이션 시스템에는 구성 가능한 내비게이션 컨텍스트 프로토콜을 갖춘 base 내비게이션 모델이 필요합니다: 명령 추적, 객체 검색, 목표 추적, 자율 주행은 동일한 인식-플래닝 백본을 공유하지만 시각적 스트림을 소비하기 위한 근본적으로 다른 맥락 전략을 요구합니다.LLM 도구 사용을 위한 모델 컨텍스트 프로토콜과 마찬가지로, 내비게이션 모델도 추론 시 이러한 다양한 컨텍스트 요구 사항을 관리하기 위해 표준화된 인터페이스가 필요합니다.Qwen-RobotNav는 Qwen3-VL을 기반으로 구축된 확장 가능한 내비게이션 모델로, 두 ..
2026.06.22 -
NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance
NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance Shanghai AI Lab, Tsinghua University, Zhejiang University, The University of Hong Kong Abstract역동적이고 복잡한 오픈 월드 환경에서 내비게이션을 학습하는 것은 자율 로봇에게 매우 중요하지만 도전적인 능력입니다.기존 접근 방식은 종종 계단식 모듈러 프레임워크에 의존하며, 이는 제한된 실제 데모 데이터로부터 광범위한 하이퍼파라미터 튜닝이나 학습을 필요로 합니다.이 논문에서는 다양한 환경과 로봇 embodiments에 걸쳐 제로샷 시뮬레이션에서 실제 전송을 가능하게 하는 ..
2026.06.10 -
An Efficient and Multi-Modal Navigation System with One-Step World Model
An Efficient and Multi-Modal Navigation System with One-Step World Model Tsinghua University, Xiaomi One-Step World Model Navigation — 느린 월드 모델을 실시간으로 끌어올린 트릭한 줄 요약: "액션을 머릿속으로 상상해보고 제일 나은 걸 고르는" 월드 모델 내비게이션은 아이디어는 좋은데 너무 느려서 실제 로봇엔 못 썼다. 이 논문은 생성을 한 방에 끝내는 트릭으로 이걸 실시간급으로 만들고, 이미지·언어·포인트 목표를 하나의 프레임워크로 묶는다.1. 무슨 문제를 푸는가월드 모델 기반 내비게이션의 핵심 아이디어는 이렇다. 로봇이 "이 액션을 하면 다음에 뭐가 보일까?"를 미리 그려보고(= 미래 관측 예측)..
2026.06.10 -
GNM: A General Navigation Model to Drive Any Robot
GNM: A General Navigation Model to Drive Any Robot UC Berkeley, Toyota Motor North America Abstract학습은 비전 기반 탐색을 위한 강력한 도구를 제공하지만, 학습 기반 정책의 기능은 제한된 학습 데이터로 인해 제약을 받습니다.다양한 종류의 로봇을 포함하여 모든 이용 가능한 소스의 데이터를 결합할 수 있다면, 더 강력한 내비게이션 모델을 학습시킬 수 있을 것입니다.이 논문에서는 비전 기반 내비게이션을 위한 일반적인 목표 조건 모델이 다양하지만 구조적으로 유사한 로봇에서 얻은 데이터를 바탕으로 어떻게 학습될 수 있는지 연구하고, 환경과 embodiments에 걸쳐 광범위한 일반화를 가능하게 합니다.우리는 로봇 간의 효과적인 데이터 ..
2026.06.05 -
RF-DETR: Neural Architecture Search for Real-Time Detection Transformers
RF-DETR: Neural Architecture Search for Real-Time Detection Transformers Roboflow, Carnegie Mellon University Abstract오픈 어휘 탐지기는 COCO에서 인상적인 성능을 발휘하지만, 일반적으로 사전 학습에서 발견되지 않는 분포 외 클래스를 가진 실제 데이터셋에는 일반화하지 못하는 경우가 많습니다.단순히 새로운 도메인을 위해 무거운 vision-language model (VLM)을 파인튜닝하는 대신, 가중치 공유 neural architecture search (NAS)을 통해 모든 타겟 데이터셋에 대해 accuracy-latency Pareto 곡선을 발견하는 경량 전문 탐지 트랜스포머인 RF-DETR을 소개합니다..
2026.06.01