2026. 6. 22. 14:26ㆍ로봇 내비게이션
Qwen-RobotNav: A Scalable Navigation Model Designed for an Agentic Navigation System
QwenTeam
에이전트 내비게이션 시스템에는 구성 가능한 내비게이션 컨텍스트 프로토콜을 갖춘 base 내비게이션 모델이 필요합니다: 명령 추적, 객체 검색, 목표 추적, 자율 주행은 동일한 인식-플래닝 백본을 공유하지만 시각적 스트림을 소비하기 위한 근본적으로 다른 맥락 전략을 요구합니다.
LLM 도구 사용을 위한 모델 컨텍스트 프로토콜과 마찬가지로, 내비게이션 모델도 추론 시 이러한 다양한 컨텍스트 요구 사항을 관리하기 위해 표준화된 인터페이스가 필요합니다.

Qwen-RobotNav는 Qwen3-VL을 기반으로 구축된 확장 가능한 내비게이션 모델로, 두 가지 상호 보완적인 차원을 가진 매개변수화된 인터페이스를 통해 이 문제를 해결합니다: 내비게이션 동작을 선택하는 작업 모드와 시각적 기록이 인코딩되는 방식을 제어하는 제어 가능한 관찰 매개변수 (토큰 예산, 시간적 감쇠, 카메라 당 가중치).
모든 매개변수에 대한 학습 시간 랜덤화를 통해 15.6M개의 샘플로 학습된 Qwen-RobotNav는 아키텍처 수정 없이 모든 추론 시간 구성에 일반화하여 단일 가중치 집합 하에서 5개의 작업 패밀리를 통합하고 에이전트 시스템의 자연스러운 구성 요소로 사용합니다.
· 통합 멀티-도메인 내비게이션: 하나의 가중치 세트를 가진 단일 모델은 5개의 내비게이션 도메인에서 SOTA 성능을 달성합니다: VLN-CE RxR에서 76.5% SR, HM3Dv2 객체 목표에서 75.6% SR (RGB 전용, depth 기반 방법 초과), EVT-Bench에서 90.0% 추적율, NAVSIM에서 91.4 PDMS, 그리고 3개의 EQA 벤치마크에서 새로운 최적 성능을 달성하며, 2B에서 8B 매개변수로 일관된 확장이 가능합니다.
· 제어 가능한 관찰 프로토콜: 4개의 축 (시각적 토큰 예산, 시간적 감소, 카메라 당 가중치, 프레임 샘플 모드)이 추론 시간 매개변수로 노출되고, 학습 시간에 샘플당 랜덤으로 처리되어 재학습이나 아키텍처 수정 없이도 모든 추론 시간 구성이 가능합니다.
· 에이전트 내비게이션 시스템: 상위 레벨 플래너 (Qwen3.7-Plus)가 장기 목표를 분해하고 구성 가능한 내비게이션 호출을 디스패치하면서 2레벨 메모리를 유지하 는 2티어 시스템 내에서 재구성 가능한 내비게이션 프리미티브로 설계되었으며, 이전 최고 수준보다 내비게이션 단계가 77% 적은 EXPRESS-Bench에서 +15.4%를 달성했습니다.
· 야생에서의 일반화: Unitree Go2에 제로샷을 배치하여 저해상도 내장 카메라 하나로 네 배로 증가시켰으며, 환경에 특화된 파인튜닝 없이도 자연스러운 환경과 제약 없는 자연어 지침에 대한 강력한 일반화를 보여주었습니다.
A Navigation Model with Controllable Context
모바일 내비게이션은 매우 다양한 요구 사항을 가진 작업을 포괄합니다.
지침을 따르는 것은 먼 랜드마크를 다시 참조하기 위해 과거 관찰에 대한 긴 기억을 요구합니다.
목표 추적은 거의 전적으로 최근 몇 프레임에 신경을 씁니다.
객체 검색이 에피소드 중반에 전환됩니다: 탐험 중의 광범위한 역사, 접근 중의 타이트한 recency.
기존의 통합 내비게이션 모델은 기억해야 할 것에 대한 단일 가정을 포함하고 있습니다.
Qwen-RobotNav는 컨텍스트를 외부에서 제어할 수 있는 최고 수준의 자유도로 취급하여 이 문제를 해결합니다.
이 모델은 에이전트가 통화당 조정할 수 있는 네 가지 제어 축을 제공합니다:
· 시각적 토큰 예산: 모든 카메라와 시간 단계에서 총 토큰 수
· 시간적 감쇠: 최근 프레임이 이전 프레임보다 얼마나 강하게 선호되는지
· 카메라 무게: 카메라당 중요도 (전방 카메라가 후방보다 더 중요함)
· 프레임 샘플 모드: 전역 히스토리 커버리지를 위한 랜덤 모드 또는 최근 기간이 촉박한 recency 모드
학습 시, 이 모든 매개변수는 샘플당 랜덤으로 추출됩니다.
모델은 고정된 구성을 보지 못하기 때문에 추론 시 어떤 설정에도 일반화됩니다.

아키텍쳐.
Qwen-RobotNav는 Qwen3-VL 백본을 계승하고 위치와 헤딩이 각각 8개의 웨이포인트를 출력하는 경량 4레이어 MLP 액션 헤드를 추가했습니다.
카메라의 정체성과 시간 순서는 시각적 토큰이 삽입된 자연어 태그를 통해 전적으로 전달됩니다:
Built for Agentic Navigation
Qwen-RobotNav는 2티어 시스템 내에서 재구성 가능한 내비게이션 프리미티브로 설계되었습니다.
상위 레벨 플래너 (Qwen3.7-Plus)는 장기 목표를 하위 목표로 분해하고, Qwen-RobotNav는 각 내비게이션 세그먼트를 반응형 웨이포인트 예측기로 실행합니다.
플래너는 에피소드 중반에 Qwen-RobotNav의 작업 모드와 컨텍스트 전략을 동적으로 전환할 수 있습니다.
두 티어는 전적으로 자연어를 통해 소통하며, 시스템을 모듈식이고 확장 가능하게 유지합니다.

각 탐색 호출은 세 가지를 지정합니다: 하위 목표 명령어, 작업 모드 (VLN / PointNav / ObjNav / Tracking), 관찰 구성.
동일한 모델 가중치는 모든 작업 단계에 적용되며 호출 인수만 변경됩니다.
장기적인 추론을 지원하기 위해 시스템은 2단계 메모리를 유지합니다.
각 내비게이션 세그먼트는 간결한 궤적 요약을 생성합니다.
지속적인 증거 노트는 여러 에피소드 (검색된 지역, 후보 객체 위치, 거부된 가설)에 걸쳐 지속 가능한 결론을 축적하므로 플래너는 항상 간결하고 관련성 있는 맥락에서 작업합니다.
Training at Scale
Qwen-RobotNav는 5개의 태스크 패밀리에 걸쳐 15.6M개의 샘플과 백본의 지각적 기반을 보존하는 비전 언어 추론 데이터를 학습했습니다.
성능은 2B에서 8B 매개변수까지 일관되게 확장되며, 장기적인 추론 작업에서 가장 두드러진 향상을 보입니다.

우리는 또한 text-to-video 생성을 프롬프트 생성, 비디오 합성, VLM 품질 필터링, 모노 뎁스 추정 및 운동학적 필터링을 통해 내비게이션 궤적으로 변환하는 자동화된 파이프라인을 도입하여 3D 장면 재구성 없이 40K개의 추가적인 사실적인 샘플을 생성합니다.
Performance
Instruction Following (VLN-CE)
R2R 및 RxR 검증에서 보이지 않는 분할에 대한 VLN 성공률의 발전 추세.
전통적인 방법들은 꾸준한 초기 진전을 보이고 있으며, 최근의 LLM/VLM 기반 접근 방식이 가장 높은 성능 향상을 주도하고 있으며, Qwen-RobotNav가 두 벤치마크 모두에서 가장 높은 성공률을 달성했습니다.

Qwen-RobotNav-8B는 R2R 벤치마크에서 72.1%의 SR, 더 긴 RxR 벤치마크에서 76.5%의 SR을 달성하여 이전 최고의 방법을 능가합니다.

Object Searching
HM3Dv2 객체-목표 내비게이션에서 Qwen-RobotNav-4B는 RGB 관측만으로 75.6%의 SR을 달성하여 모든 depth 기반 방법을 능가하고 평균적으로 목표 지점에서 1.72m에 도달합니다.

Active Visual Tracking
EVT-Bench에서 Qwen-RobotNav는 90.0%로 전용 트래커와 제너럴리스트 모델을 모두 초과하는 최고의 트래킹 속도를 달성했습니다.

Embodied Question Answering
에이전트 시스템을 갖춘 Qwen-RobotNav는 세 가지 EQA 벤치마크에서 이전 방법을 상당한 차이로 능가하는 새로운 SOTA 결과를 제시합니다.

Autonomous Driving (NAVSIM)
폐루프 주행 평가에서 Qwen-RobotNav-4B는 91.4 PDMS를 달성하여 전문 주행 모델을 능가합니다.

Qwen-RobotNav는 NAVSIM과 AlpaSim 폐루프 시뮬레이터 (제로샷)에서 시간적으로 일관된 곡선 궤적을 생성합니다.
Real-World Deployment
우리는 NVIDIA Jetson Thor를 통해 기기 내 추론 기능을 갖춘 Unitree Go2 사족 로봇에 Qwen-RobotNav를 배포하여 196ms latency (5.1Hz)을 달성했습니다.
유일한 시각적 입력은 Go2의 내장 저해상도 카메라입니다.
모든 실험은 환경별 파인튜닝 없이 이전에 보지 못한 환경에서 제로샷으로 수행됩니다.
Deployment
로봇은 세부적인 공간 지시에 따라 침실, 거실, 욕실을 오가며 단계별 구두 지시를 통해 아파트 환경에서 내비게이션 작업을 수행합니다.
Instruction Following
우리는 보이지 않는 전시장에서 왕복 내비게이션 작업을 평가합니다: 로봇은 먼저 언어 지시에 따라 거실에서 병실까지 21.78m를 이동한 다음 후진 명령을 받아 전체 경로를 정확하게 추적해야 합니다.
이는 모델이 장거리에서도 공간 인식을 유지하고, 전방 및 후방 모두에서 다양한 시각적 랜드마크를 접지하며, 언어만으로 정확한 양방향 위치 제어를 수행해야 하기 때문에 특히 어렵습니다.
Agentic Navigation
에이전트 모드에서는 시스템이 단순한 경로 추적을 넘어 개방형 요청을 지원합니다.
"check whether a green umbrella was left at Cotti Coffee,"라는 지침이 주어지면 에이전트는 작업을 하위 목표로 분해하고, 복도 랜드마크를 사용하여 위치를 파악하고, 타겟 장면을 검사하며, 사람의 개입 없이 근거 있는 답변을 생성합니다.
What's Next
Qwen-RobotNav는 멀티태스크 내비게이션을 컨텍스트 모델링 문제로 재구성합니다: 다양한 작업은 동일한 인식과 계획의 근간을 공유하지만, 관찰을 소비하기 위해서는 서로 다른 전략이 필요합니다.
컨텍스트를 외부에서 제어할 수 있는 인터페이스로 취급하면 단일 모델이 에이전트 시스템 내에서 실용적이고 배포 가능한 내비게이션 프리미티브 역할을 할 수 있습니다.