Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

2026. 3. 4. 16:23Robotics

Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

 

Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn

 

Abstract

케이블 타이나 배터리 슬롯과 같은 미세한 조작 작업은 정밀도, 접촉력의 세심한 조정, 폐쇄 루프 시각 피드백이 필요하기 때문에 로봇에게 매우 어렵습니다.
이러한 작업을 수행하려면 일반적으로 고급 로봇, 정확한 센서 또는 세심한 보정이 필요하며, 이는 비용이 많이 들고 설정하기 어려울 수 있습니다.
학습이 저비용 및 부정확한 하드웨어가 이러한 미세한 조작 작업을 수행할 수 있게 할 수 있을까요?
우리는 맞춤형 원격 조작 인터페이스로 수집된 실제 시연에서 직접 종단 간 모방 학습을 수행하는 저비용 시스템을 소개합니다.
그러나 모방 학습은 특히 고정밀 영역에서 고유한 도전 과제를 제시합니다: 정책의 오류는 시간이 지남에 따라 더욱 악화될 수 있으며, 인간의 시연은 비정상적일 수 있습니다.
이러한 문제를 해결하기 위해, 우리는 액션 시퀀스에 대한 생성 모델을 학습하는 간단하면서도 새로운 알고리즘인 Action Chunking with Transformers (ACT)를 개발했습니다.
ACT를 사용하면 로봇이 반투명 조미료 컵을 열고 배터리를 80~90% 성공적으로 슬롯에 넣는 등 실제 세계에서 10분 분량의 시연만으로 6가지 어려운 작업을 학습할 수 있습니다.

 

 

그림 1: ALOHA: 양방향 원격 운영을 위한 저비용 오픈 소스 하드웨어 시스템. 기성품 로봇과 3D 프린팅 부품을 포함한 전체 시스템의 가격은 2만 달러 미만입니다. 왼쪽: 사용자는 리더 로봇을 후진시켜 원격 조작하고, 팔로워 로봇은 액션을 미러링합니다. 오른쪽: ALOHA는 정확하고 접촉이 풍부하며 역동적인 작업을 수행할 수 있습니다. 원격 조작 기술과 학습된 기술의 예를 모두 보여드립니다.

Ⅰ. Introduction

미세한 조작 작업은 정밀하고 폐쇄적인 피드백을 포함하며, 환경 변화에 대응하여 조정하고 재계획하기 위해 고도의 hand-eye 협응력이 필요합니다.
이러한 조작 작업의 예로는 조미료 컵의 뚜껑을 열거나 배터리 슬롯을 채우는 것이 포함되며, 이는 따거나 놓는 것과 같은 넓은 스트로크 동작보다는 꼬집기, 물어뜯기, 찢기와 같은 섬세한 작업을 포함합니다.
그림 1의 조미료 컵 뚜껑을 여는 예를 들어, 컵이 테이블 위에서 똑바로 초기화됩니다: 오른쪽 그리퍼는 먼저 그것을 뒤집고 열린 왼쪽 그리퍼에 밀어 넣어야 합니다.
그런 다음 왼쪽 그립퍼가 부드럽게 닫히고 컵을 테이블에서 들어 올립니다.
다음으로, 오른손 손가락 중 하나가 컵 아래에서 다가와 뚜껑을 열어줍니다.
이러한 각 단계에는 높은 정밀도, 섬세한 손과 눈의 협응력, 풍부한 접촉이 필요합니다.

밀리미터의 오차는 작업 실패로 이어질 수 있습니다.

 

기존의 미세 조작 시스템은 정밀한 상태 추정을 위해 고가의 로봇과 고급 센서를 사용합니다 [29, 60, 32, 41].
이 연구에서는 접근 가능하고 재현 가능한 저비용 미세 조작 시스템을 개발하고자 합니다.
그러나 저가 하드웨어는 고급 플랫폼보다 정밀도가 떨어질 수밖에 없기 때문에 감지 및 계획 문제가 더욱 두드러집니다.
이 문제를 해결하기 위한 유망한 방향 중 하나는 학습을 시스템에 통합하는 것입니다.
인간은 또한 산업용 등급의 고유 수용성을 가지고 있지 않지만 [71], 폐루프 시각 피드백을 통해 학습하고 오류를 적극적으로 보완함으로써 섬세한 작업을 수행할 수 있습니다.
따라서 우리 시스템에서는 상용 웹 카메라의 RGB 이미지를 작업에 직접 매핑하는 종단 간 정책을 학습합니다.
이 pixel-to-action 공식은 특히 미세한 조작에 적합합니다, 이는 복잡한 물리적 특성을 가진 객체를 포함하는 경우가 많기 때문에 조작 정책을 학습하는 것이 전체 환경을 모델링하는 것보다 훨씬 간단합니다.
조미료 컵의 예를 들어보겠습니다: 컵을 밀 때의 접촉을 모델링하고 뚜껑을 열 때의 변형을 모델링하는 것은 많은 자유도에 대한 복잡한 물리학을 포함합니다.
계획을 세울 만큼 정확한 모델을 설계하려면 상당한 연구와 과제별 엔지니어링 노력이 필요합니다.
반대로, 컵을 밀고 여는 정책은 훨씬 간단합니다, 왜냐하면 폐쇄 루프 정책은 컵과 뚜껑의 위치를 미리 정확하게 예측하는 것보다 반응할 수 있기 때문입니다.

 

그러나 종단 간 정책을 학습하는 것은 자체적인 도전 과제를 제시합니다.
정책의 성과는 학습 데이터 분포에 크게 좌우되며, 미세한 조작의 경우 고품질의 인간 데모를 통해 시스템이 인간의 손재주로부터 학습할 수 있도록 함으로써 엄청난 가치를 제공할 수 있습니다.
따라서 우리는 데이터 수집을 위한 저비용이면서도 능숙한 원격 조작 시스템과 데모를 통해 효과적으로 학습할 수 있는 새로운 모방 학습 알고리즘을 구축합니다.
다음 두 단락에서 각 구성 요소를 개괄적으로 살펴봅니다.

 

Teleoperation system.

저희는 저가형 기성 로봇 팔 두 세트로 원격 조작 설정을 고안했습니다.
그것들은 대략적으로 서로의 축소된 버전이며, 우리는 원격 조작을 위해 공동 공간 매핑을 사용합니다.
우리는 이 설정을 3D 프린팅 부품으로 보완하여 더 쉽게 후진할 수 있도록 하여, 2만 달러의 예산 내에서 매우 뛰어난 원격 조작 시스템을 제공합니다.
우리는 그림 1에서 그 기능을 보여줍니다, 여기에는 지퍼 타이를 꿰는 것과 같은 정밀 작업의 원격 조작, 탁구공 저글링과 같은 동적 작업, 그리고 NIST 보드 #2에서 체인을 조립하는 것과 같은 접촉이 많은 작업이 포함됩니다 [4].

 

Imitation learning algorithm.

정밀도와 시각적 피드백이 필요한 작업은 고품질 데모에서도 모방 학습에 상당한 도전 과제를 제시합니다.
예측된 행동의 작은 오류는 상태에 큰 차이를 초래할 수 있으며, 이는 모방 학습의 "compounding error" 문제를 악화시킬 수 있습니다 [47, 64, 29].
이 문제를 해결하기 위해, 우리는 액션 청킹에서 영감을 받았습니다, 이 개념은 심리학에서 일련의 액션들이 어떻게 하나의 청크로 묶여 하나의 단위로 실행되는지를 설명하는 개념입니다 [35].
우리의 경우, 정책은 한 번에 한 걸음씩이 아니라 다음 k번의 목표 공동 위치를 예측합니다.
이렇게 하면 작업의 유효 범위가 k배 줄어들어 compounding error 가 완화됩니다.
액션 시퀀스를 예측하는 것은 또한 마르코프 단일 단계 정책으로는 모델링하기 어려운 데모의 일시 정지와 같은 시간적으로 상관된 혼란을 해결하는 데 도움이 됩니다 [61].
정책의 원활성을 더욱 향상시키기 위해, 우리는 정책을 더 자주 질의하고 겹치는 액션 청크에 대해 평균을 내는 시간적 앙상블을 제안합니다.
우리는 시퀀스 모델링을 위해 설계된 아키텍처인 트랜스포머 [65]를 사용하여 액션 청킹 정책을 구현하고, 이를 conditional VAE (CVAE)로 학습하여 인간 데이터의 변동성을 포착합니다 [55, 33].
우리는 우리의 방법을 Action Chunking with Transformers (ACT)이라고 명명하고, 다양한 시뮬레이션 및 실제 미세 조작 작업에서 이전의 모방 학습 알고리즘을 크게 능가한다는 것을 발견했습니다.

 

이 논문의 주요 기여는 원격 조작 시스템과 새로운 모방 학습 알고리즘으로 구성된 저비용 미세 조작 학습 시스템입니다.
원격 운영 시스템은 저렴한 비용에도 불구하고 높은 정밀도와 풍부한 접점을 갖춘 작업을 가능하게 합니다.
모방 학습 알고리즘인 Action Chunking with Transformers (ACT)는 정밀하고 폐쇄적인 액션을 학습할 수 있으며 이전 방법들을 크게 능가합니다.
이 두 부분의 시너지 덕분에 반투명 조미료 컵을 열고 배터리를 80~90% 성공적으로 슬롯링하는 등 실제 세계에서 단 10분 또는 50번의 데모 궤적만으로 6가지 미세 조작 기술을 직접 학습할 수 있습니다.

 

 

 

Ⅱ. Related Work

Imitation learning for robotic manipulation.

모방 학습은 로봇이 전문가로부터 직접 학습할 수 있게 해줍니다.
Behavioral cloning (BC) [44] 는 관찰에서 액션에 이르기까지 모방을 지도 학습으로 간주하는 가장 간단한 모방 학습 알고리즘 중 하나입니다.
많은 작품들이 BC를 개선하기 위해 노력해 왔습니다, 예를 들어, 다양한 아키텍처의 역사를 통합하고 [39, 49, 26, 7], 다른 학습 objective를 사용하고 [17, 42], 그리고 정규화를 포함한 [46] 등이 있습니다.
다른 연구들은 모방 학습 [14, 25, 11]의 멀티태스크 또는 퓨샷 측면을 강조하며, 언어 [51, 52, 26, 7]를 활용하거나 특정 작업 구조 [43, 68, 28, 52]를 활용합니다.
이러한 모방 학습 알고리즘을 더 많은 데이터로 확장함으로써 새로운 객체, 지침 또는 장면으로 일반화할 수 있는 인상적인 시스템이 탄생했습니다 [15, 26, 7, 32].
이 연구에서는 저비용이면서도 섬세하고 세밀한 조작 작업을 수행할 수 있는 모방 학습 시스템을 구축하는 데 중점을 둡니다.
우리는 하드웨어와 소프트웨어 모두에서 고성능 원격 운영 시스템을 구축하고, 미세한 조작 작업에서 이전 방법을 획기적으로 개선한 새로운 모방 학습 알고리즘을 통해 이 문제를 해결합니다.

 

Addressing compounding errors.

BC의 주요 단점 중 하나는 이전 시간 단계에서 발생한 오류가 누적되어 로봇이 학습 분포에서 벗어나 회복하기 어려운 상태로 이어지는 복합 오류입니다 [47, 64].
이 문제는 특히 미세한 조작 환경에서 두드러집니다 [29].
복리 오류를 완화하는 한 가지 방법은 DAgger [47] 및 그 변형 [30, 40, 24]와 같은 추가적인 온-정책 상호작용 및 전문가 수정을 허용하는 것입니다.
그러나 원격 조작 인터페이스에서는 전문가 주석이 시간이 많이 걸리고 부자연스러울 수 있습니다 [29].
데모 수집 시간에 노이즈를 주입하여 수정 액션이 있는 데이터셋을 얻을 수도 있지만 [36], 미세한 조작의 경우 이러한 노이즈 주입은 작업 실패로 이어져 원격 운영 시스템의 손재주를 줄일 수 있습니다.
이러한 문제를 피하기 위해 이전 연구들은 오프라인 방식으로 합성 보정 데이터를 생성했습니다 [16, 29, 70].
저차원 상태가 가능한 설정이나 그립과 같은 특정 유형의 작업에만 제한됩니다.
이러한 한계로 인해, 우리는 고차원 시각 관측과 호환되는 다른 각도에서 복합 오류 문제를 해결해야 합니다.
우리는 액션 청킹을 통해 작업의 효과적인 지평을 줄이는 것을 제안합니다, 즉, 단일 액션 대신 액션 시퀀스를 예측한 다음, 겹치는 액션 청크를 결합하여 정확하고 매끄러운 궤적을 생성하는 것입니다.

 

Bimanual manipulation.

이중 수동 조작은 로봇 공학 분야에서 오랜 역사를 가지고 있으며, 하드웨어 비용이 낮아지면서 인기를 얻고 있습니다.
초기 연구들은 고전적인 제어 관점에서 이중 수동 조작을 다루며, 알려진 환경 역학 [54, 48]을 가지고 있습니다, 그러나 이러한 모델을 설계하는 것은 시간이 많이 걸릴 수 있으며, 복잡한 물리적 특성을 가진 물체에 대해서는 정확하지 않을 수 있습니다.
최근에는 강화 학습 [9, 10], 인간 데모 [34, 37, 59, 67, 32]를 모방하거나 모터 프리미티브를 연결하는 주요 지점을 예측하는 학습[20, 19, 50]과 같은 이중 수동 시스템에 학습이 통합되었습니다.
일부 작업은 매듭 풀기, 천 평탄화, 심지어 바늘 꿰기와 같은 세밀한 조작 작업에도 초점을 맞추고 있으며, da Vinci 수술 로봇이나 ABB YuMi와 같이 훨씬 더 비싼 로봇을 사용하기도 합니다 [19, 18, 31].
우리의 작업은 개당 약 5천 달러의 저렴한 하드웨어, 예를 들어 무기를 사용하여 고정밀 폐쇄 루프 작업을 수행할 수 있도록 하는 것입니다.
우리의 원격 운영 설정은 리더와 팔로워 로봇 간의 공동 공간 매핑을 사용하는 Kim et al. [32]과 가장 유사합니다.
이전 시스템과 달리, 저희는 특별한 인코더, 센서 또는 기계 부품을 사용하지 않습니다.
저희는 기성 로봇과 소수의 3D 프린팅 부품만으로 시스템을 구축하여 비전문가들이 2시간 이내에 조립할 수 있도록 합니다.

 

 

 

Ⅲ. ALOHA: A Low-cost Open-source Hardware System for Bimanual Teleoperation

우리는 미세한 조작을 위한 접근 가능하고 고성능의 원격 조작 시스템을 개발하고자 합니다.
디자인 고려 사항을 다음 5가지 원칙으로 요약합니다.

 1) Low-cost: 전체 시스템은 대부분의 로봇 실험실에 대해 단일 산업 부문에 필적하는 예산 범위 내에 있어야 합니다. 
 2) Versatile: 실제 물체를 사용하는 다양한 미세 조작 작업에 적용할 수 있습니다. 
 3) User-friendly: 시스템은 직관적이고 신뢰할 수 있으며 사용하기 쉬워야 합니다.
 4) Repairable: 설치가 불가피하게 고장 났을 때 연구자들이 쉽게 수리할 수 있습니다.
 5) Easy-to-build: 연구자들이 쉽게 구할 수 있는 재료로 빠르게 조립할 수 있습니다.

 

사용할 로봇을 선택할 때, 원칙 1, 4, 5는 두 개의 ViperX 6-DoF 로봇 팔이 있는 이중 수동 평행 턱 그립퍼 설정을 구축하도록 안내합니다 [1, 66].
가격 및 유지보수 고려 사항으로 인해 손재주가 뛰어난 손재주를 사용하지 않습니다.
사용된 ViperX 팔은 750g의 작동 하중과 1.5m의 스팬을 가지고 있으며, 정확도는 5-8mm입니다.
로봇은 모듈식이며 수리가 간단합니다: 모터 고장 시 저렴한 Dynamixel 모터를 쉽게 교체할 수 있습니다.
이 로봇은 기성품으로 약 $5600에 구입할 수 있습니다.
그러나 OEM 핑거는 미세한 조작 작업을 처리할 만큼 다재다능하지 않습니다.

따라서 저희는 3D 프린팅된 "see-through" 핑거를 직접 디자인하고 그립 테이프로 장착했습니다 (그림 3).

이를 통해 섬세한 작업을 수행할 때 시야가 좋고 얇은 플라스틱 필름으로도 견고하게 잡을 수 있습니다.

그림 3: 왼쪽: 전면, 상단 및 두 개의 손목 카메라의 카메라 시점과 함께 ALOHA의 이중 수동 작업 공간에 대한 그림. 중간: "handle and scissor" 메커니즘과 맞춤형 그리퍼에 대한 디테일 뷰. 오른: ViperX 6d 로봇의 기술 사양 [1].

그런 다음 ViperX 로봇 주변에서 최대한 사용자 친화적인 원격 운영 시스템을 설계하려고 합니다.
VR 컨트롤러나 카메라로 캡처한 손 포즈를 로봇의 엔드 이펙터 포즈, 즉 작업 공간 매핑으로 매핑하는 대신, 같은 회사에서 제조한 작은 로봇인 WidowX의 직접 관절 공간 매핑을 사용하며 가격은 $3300입니다 [2].
사용자는 더 작은 WidowX ("the leader")를 후진하여 원격 조작하며, 이들의 관절은 더 큰 ViperX ("the follower")와 동기화됩니다.
설정을 개발할 때 작업 공간에 비해 공동 공간 매핑을 사용하는 것의 몇 가지 이점을 발견했습니다.
(1) 미세한 조작은 종종 로봇의 특이점 근처에서 작동해야 하는데, 우리의 경우 6자유도를 가지며 중복성이 없습니다.
기성품 inverse kinematics (IK)은 이 설정에서 자주 실패합니다.

반면에 공동 공간 매핑은 조인트 한계 내에서 고대역폭 제어를 보장하면서도 계산 비용을 줄이고 지연 시간을 줄입니다.
(2) 리더 로봇의 무게는 사용자가 너무 빨리 움직이는 것을 방지하고 작은 진동도 줄여줍니다.
우리는 VR 컨트롤러를 사용하는 것보다 공동 공간 매핑을 통해 정확한 작업에서 더 나은 성능을 확인합니다.
원격 조작 경험을 더욱 향상시키기 위해, 우리는 리더 로봇에 개조할 수 있는 3D 프린팅 "handle and scissor" 메커니즘을 설계했습니다 (그림 3).
모터를 역구동하는 데 필요한 작업자의 힘을 줄여주며, 이진 개폐 대신 그리퍼를 지속적으로 제어할 수 있게 해줍니다.
우리는 또한 리더 측의 중력을 부분적으로 상쇄하는 고무 밴드 하중 균형 메커니즘을 설계합니다.
운영자의 노력을 줄이고 더 긴 원격 운영 세션 (예: > 30분)을 가능하게 합니다.

 

나머지 설정에는 20x20mm 알루미늄 돌출부가 있는 로봇 케이지가 포함되어 있으며, 교차 강철 케이블로 보강되었습니다.
총 네 개의 Logitech C922x 웹캠이 있으며, 각각 480x640 RGB 이미지를 스트리밍합니다.
두 개의 웹캠이 팔로워 로봇의 손목에 장착되어 있어 그립퍼를 가까이서 볼 수 있습니다.
나머지 두 대의 카메라는 각각 전면과 상단에 장착되어 있습니다 (그림 3).
원격 작동과 데이터 녹화는 모두 50Hz에서 이루어집니다.

 

위의 설계 고려 사항을 바탕으로, 우리는 Franka Emika Panda와 같은 단일 연구 부서와 유사한 2만 달러 예산 내에서 양방향 원격 운영 설정 ALOHA를 구축합니다.
ALOHA는 원격 운영을 가능하게 합니다:

 · 지퍼 케이블 타이 실을 꿰고, 지갑에서 신용카드를 꺼내고, 지퍼백을 열거나 닫는 등의 정확한 작업을 수행합니다.
 · 컴퓨터 마더보드에 288핀 RAM 삽입, 책 페이지 넘기기, NIST 보드 #2의 체인 및 벨트 조립 등 접촉이 많은 작업 [4]
 · 탁구공을 실제 탁구 패들과 저글링하고 공이 떨어지지 않도록 균형을 맞추고, 열린 비닐봉지를 공중에 휘두르는 등 역동적인 작업.

그림 9: ALOHA를 사용한 원격 조 작업 예제.

기존 원격 운영 시스템에서는 예산의 5~10배에 달하는 지퍼 타이 실을 꿰기, RAM 삽입, 탁구공 저글링과 같은 기술을 사용할 수 없습니다 [21, 5].
부록 A에는 더 자세한 가격 및 기능 비교가 포함되어 있으며, 그림 9에는 ALOHA가 할 수 있는 더 많은 기술이 포함되어 있습니다.
ALOHA에 더 쉽게 접근할 수 있도록, 우리는 모든 소프트웨어와 하드웨어를 오픈 소스로 제공하며 3D 프린팅에 대한 자세한 튜토리얼을 제공합니다, 이 튜토리얼은 프레임을 소프트웨어 설치에 맞게 조립합니다.

 

 

 

Ⅳ. Action Chunking with Transformers

섹션 V에서 볼 수 있듯이, 기존의 모방 학습 알고리즘은 고주파 제어와 폐루프 피드백이 필요한 세밀한 작업에서 성능이 떨어집니다.
따라서 우리는 ALOHA에서 수집한 데이터를 활용하기 위해 새로운 알고리즘인 Action Chunking with Transformers (ACT)를 개발합니다.
먼저 학습 ACT 파이프라인을 요약한 다음 각 설계 선택 사항에 대해 자세히 살펴봅니다.

 

새로운 과제에 대해 ACT를 학습시키기 위해 먼저 ALOHA를 사용하여 인간 데모를 수집합니다.
우리는 리더 로봇의 공동 위치 (즉, 인간 작업자의 입력)를 기록하고 이를 액션으로 사용합니다.
팔로워의 위치 대신 리더의 관절 위치를 사용하는 것이 중요합니다, 왜냐하면 낮은 수준의 PID 컨트롤러를 통해 가해지는 힘의 양은 그들 간의 차이에 의해 암묵적으로 정의되기 때문입니다.
관찰 결과는 팔로워 로봇의 현재 관절 위치와 4대의 카메라에서 제공되는 이미지로 구성되어 있습니다.
다음으로, 현재 관찰 결과를 바탕으로 향후 액션의 순서를 예측하기 위해 ACT를 학습시킵니다.
여기서 액션은 다음 단계에서 양쪽 팔의 목표 관절 위치에 해당합니다.
직관적으로 ACT는 현재 관찰된 내용을 바탕으로 다음 시간 단계에서 인간 운영자가 무엇을 할지 모방하려고 합니다.
이러한 목표 관절 위치는 Dynamixel 모터 내부의 저주파 고주파 PID 컨트롤러에 의해 추적됩니다.
테스트 시 가장 낮은 검증 loss를 달성하는 정책을 로드하고 환경에서 롤아웃합니다.
발생하는 주요 과제는 이전 작업에서 발생한 오류가 학습 분포를 벗어난 상태로 이어지는 오류를 복합화하는 것입니다.

 

A. Action Chunking and Temporal Ensemble

모방 학습의 복합 오류를 해결하기 위해 pixel-to-action 정책 (그림 II)과 호환되는 방식으로 고주파에서 수집되는 긴 궤적의 유효 지평을 줄이려고 합니다.
우리는 개별 액션을 하나의 단위로 묶어 하나의 단위로 실행하는 신경과학 개념인 액션 청킹에서 영감을 받아 저장하고 실행하기에 더 효율적입니다 [35].
직관적으로, 액션의 일부는 사탕 포장지의 모서리를 잡거나 배터리를 슬롯에 삽입하는 것과 일치할 수 있습니다.
구현에서는 청크 크기를 k로 고정합니다: 에이전트는 매 k 단계마다 관찰을 받아 다음 k개의 액션을 생성하고 순차적으로 액션을 실행합니다 (그림 5).
이는 작업의 유효 범위가 k배 감소한다는 것을 의미합니다.
구체적으로, 정책은 π_θ(a_t|s_t) 대신 π_θ(a_(t:t+k)|s_t)를 모델링한다.
청킹은 또한 인간 데모에서 비마르코프적 액션을 모델링하는 데 도움이 될 수 있습니다.
구체적으로, 단일 단계 정책은 상태뿐만 아니라 시간 단계에 따라 액션이 달라지기 때문에 데모 도중 일시 정지와 같은 시간적으로 상관된 혼란 요인으로 어려움을 겪을 수 있습니다 [61].
액션 청킹은 과거 조건 정책에 대한 인과적 혼동 문제를 도입하지 않고도 혼란이 클 때 이 문제를 완화할 수 있습니다 [12].

그림 5: 우리는 액션을 적용할 때 관찰하고 실행하는 대신 액션 청킹과 시간적 앙상블을 모두 사용합니다.

나이브한 액션 청킹 구현은 최적이 아닐 수 있습니다: 새로운 환경 관측이 갑자기 매 k 걸음마다 통합되어 덜컥거리는 로봇의 움직임을 초래할 수 있습니다.
매끄러움을 개선하고 실행과 관찰 간의 이산 전환을 피하기 위해, 우리는 매 시간 단계마다 정책을 질의합니다.
이로 인해 서로 다른 액션 청크가 겹치게 되며, 주어진 시간 단계에서 여러 가지 예측된 액션이 발생하게 됩니다.
우리는 이를 그림 5에 설명하고 이러한 예측을 결합하기 위한 시간적 앙상블을 제안합니다.
우리의 시간적 앙상블은 지수 가중치 체계 w_i = exp (-m * i)를 사용하여 이러한 예측에 대한 가중 평균을 수행합니다, 여기서 w_0은 가장 오래된 액션에 대한 가중치입니다.
새로운 관측값을 통합하는 속도는 m에 의해 결정되며, m이 작을수록 통합 속도가 빨라집니다.
일반적인 스무딩과는 달리, 현재 액션이 인접한 시간 단계의 액션과 결합하여 편향을 초래하는 경우, 동일한 시간 단계에서 예측된 액션을 결합합니다.
이 절차는 추가적인 학습 비용 없이 추가적인 추론 시간 계산만 필요로 합니다.
실제로, 우리는 액션 청킹과 시간적 앙상블이 ACT의 성공에 중요하다는 것을 발견했습니다, 이는 정확하고 부드러운 움직임을 만들어냅니다.
우리는 이 구성 요소들에 대해 VI-A 섹션의 ablation 연구에서 더 자세히 논의합니다.

그림 4: Action Chunking with Transformers (ACT)의 아키텍처. 우리는 ACT를 인코더와 디코더를 갖춘 Conditional VAE (CVAE)로 학습합니다. 왼쪽: CVAE의 인코더는 액션 시퀀스와 관절 관찰을 스타일 변수인 z로 압축합니다. 인코더는 테스트 시간에 폐기됩니다. 오른쪽: ACT의 디코더 또는 정책은 트랜스포머 인코더를 사용하여 여러 시점, 관절 위치, z의 이미지를 합성하고, 트랜스포머 디코더를 사용하여 일련의 액션을 예측합니다. z는 단순히 테스트 시점에서 이전 값 (즉, 0)의 평균으로 설정됩니다.

B. Modeling human data

또 다른 도전 과제는 노이즈 인간 데모에서 배우는 것입니다.
동일한 관찰이 주어졌을 때, 인간은 다양한 경로를 사용하여 과제를 해결할 수 있습니다.
정밀도가 덜 중요한 지역에서는 인간이 더 확률적일 것입니다 [38].
따라서 정책은 높은 정밀도가 중요한 지역에 집중하는 것이 중요합니다.
우리는 액션 청킹 정책을 생성 모델로 학습하여 이 문제를 해결합니다.
구체적으로, 우리는 현재 관찰에 기반한 액션 시퀀스를 생성하기 위해 정책을 conditional variational autoencoder (CVAE) [55]로 학시킵니다.
CVAE에는 두 가지 구성 요소가 있습니다: 그림 4의 왼쪽과 오른쪽에 각각 설명된 CVAE 인코더와 CVAE 디코더.
CVAE 인코더는 CVAE 디코더 (정책)를 학습하는 역할만 하며 테스트 시 폐기됩니다.
구체적으로, CVAE 인코더는 현재 관측값과 액션 시퀀스를 입력으로 주어졌을 때 대각선 가우시안으로 매개변수화된 스타일 변수 z의 분포의 평균과 분산을 예측합니다.
더 빠른 실습 학습을 위해 이미지 관찰은 생략하고 고유 수용적 관찰과 액션 순서에만 조건을 달았습니다.
CVAE 디코더, 즉 정책은 z와 현재 관측값 (이미지 + 공동 위치) 모두에 대한 조건을 제공하여 액션 순서를 예측합니다.
테스트 시점에서 z를 이전 분포의 평균, 즉 0으로 설정하여 결정적으로 디코딩합니다.
전체 모델은 두 가지 항을 가진 표준 VAE objective를 사용하여 데모 액션 청크, 즉 min_θ - ∑log π_θ(a_(t:t+k)|s_t)의 로그 가능성을 최대화하도록 학습됩니다: 재구성 loss와 인코더를 가우시안 prior로 정규화하는 항.
[23]에 이어 두 번째 항에 하이퍼파라미터 β를 추가합니다.
직관적으로 β가 높을수록 z [62]에서 전송되는 정보가 줄어듭니다.

전반적으로, 우리는 CVAE objective가 인간 데모를 통해 정확한 과제를 학습하는 데 필수적이라는 것을 발견했습니다.
우리는 하위섹션 Ⅵ-B에 더 자세한 논의를 포함합니다.

 

C. Implementing ACT

우리는 트랜스포머를 사용하여 CVAE 인코더와 디코더를 구현합니다, 트랜스포머는 시퀀스 간의 정보를 합성하고 새로운 시퀀스를 생성하기 위해 설계되었습니다.
CVAE 인코더는 BERT-like 트랜스포머 인코더로 구현됩니다 [13].
인코더에 입력되는 것은 현재 공동 위치와 데모 데이터셋의 길이 k의 타겟 액션 시퀀스이며, BERT와 유사한 학습된 "[CLS]" 토큰이 앞에 붙습니다.
이것은 k+2 길이 입력을 형성합니다 (그림 4 왼쪽).
트랜스포머를 통과한 후, "[CLS]"에 해당하는 피쳐를 사용하여 "style variable" z의 평균과 분산을 예측하고, 이를 디코더의 입력으로 사용합니다.
CVAE 디코더 (즉, 정책)는 현재 관측값과 z를 입력으로 받아 다음 k 액션을 예측합니다 (그림 4 오른쪽).

우리는 ResNet 이미지 인코더, 트랜스포머 인코더, 트랜스포머 디코더를 사용하여 CVAE 디코더를 구현합니다.
직관적으로 트랜스포머 인코더는 다양한 카메라 관점, 관절 위치, 스타일 변수에서 정보를 합성하고, 트랜스포머 디코더는 일관된 액션 시퀀스를 생성합니다.
관찰에는 각각 480x640 해상도의 RGB 이미지 4개와 두 로봇 팔의 관절 위치 (총 7+7=14 DoF)가 포함됩니다.
액션 공간은 14차원 벡터인 두 로봇의 절대 관절 위치입니다.
따라서 액션 청킹을 사용하면 현재 관측치에 따라 정책은 k x 14 텐서를 출력합니다.
정책은 먼저 ResNet18 백본 [22]으로 이미지를 처리하여 480 x 640 x 3 RGB 이미지를 15 x 20 x 512 피쳐 맵으로 변환합니다.
그런 다음 공간 차원을 따라 평탄화하여 300 x 512의 시퀀스를 얻습니다.
공간 정보를 보존하기 위해 피쳐 시퀀스에 2D 사인파 위치 임베딩을 추가합니다 [8].
모든 4개의 이미지에 대해 이 작업을 반복하면 1200 x 512 크기의 피쳐 시퀀스를 얻을 수 있습니다.
그런 다음 두 가지 피쳐를 추가합니다: 현재 관절 위치와 "style variable" z.
그들은 원래의 차원에서 각각 선형 레이어를 통해 512로 투영됩니다.
따라서 트랜스포머 인코더의 입력값은 1202x512입니다.

트랜스포머 디코더는 입력 시퀀스가 고정 위치 임베딩이고 차원이 k x 512이며 키와 값이 인코더에서 나오는 크로스-어텐션을 통해 인코더 출력을 조건으로 합니다.
이를 통해 트랜스포머 디코더는 출력 차원이 k x 512가 되며, MLP를 사용하여 다음 k 단계에서 예측된 타겟 관절 위치에 해당하는 k x 14로 하향 투영됩니다.
우리는 더 일반적인 L2 loss 대신 L1 loss를 재구성에 사용합니다: 우리는 L1 loss가 액션 순서의 더 정밀한 모델링으로 이어진다는 점에 주목했습니다.
우리는 또한 타겟 관절 위치 대신 델타 관절 위치를 액션으로 사용할 때 성능 저하를 지적했습니다.
부록 C에 자세한 아키텍처 다이어그램을 포함하고 있습니다.

알고리즘 1과 2에서 ACT의 학습과 추론을 요약합니다.
이 모델에는 약 8천만 개의 매개변수가 있으며, 각 작업에 대해 처음부터 학습합니다.
학습은 11G RTX 2080 Ti GPU 하나로 약 5시간이 소요되며, 추론 시간은 동일한 기기에서 약 0.01초입니다.

 

 

 

Ⅴ. Experiments

우리는 미세한 조작 작업에서 ACT의 성능을 평가하기 위한 실험을 제시합니다.
재현성을 용이하게 하기 위해, 우리는 MuJoCo [63]에서 두 개의 시뮬레이션된 미세 조작 작업과 ALOHA를 사용한 6개의 실제 작업을 구축했습니다.

그림 6: 실제 작업 정의. 6개의 실제 작업 각각에 대해 초기화와 하위 작업을 설명합니다.

A. Tasks

8개의 작업 모두 세밀한 이중 수동 조작이 필요하며 그림 6에 나와 있습니다.
Slide Ziploc의 경우, 오른쪽 그립퍼가 지퍼락 백의 슬라이더를 정확하게 잡고 열어야 하며, 왼쪽 그립퍼가 백의 본체를 고정해야 합니다.
Slot Battery의 경우, 오른쪽 그립퍼가 먼저 배터리를 리모컨 슬롯에 넣은 다음 손가락 끝을 사용하여 배터리가 완전히 삽입될 때까지 배터리 가장자리를 섬세하게 밀어 넣어야 합니다.
배터리 슬롯 내부의 스프링 때문에 삽입 시 리모컨이 반대 방향으로 움직이기 때문에 왼쪽 그립퍼가 리모컨을 아래로 눌러 제자리에 고정합니다.

Open Cup의 목표는 작은 조미료 컵의 뚜껑을 여는 것입니다.
컵의 크기가 작기 때문에 그립퍼는 컵 본체를 측면에서 접근하기만 하면 잡을 수 없습니다.
따라서 우리는 두 그립퍼를 모두 활용합니다: 오른손 손가락으로 먼저 컵 가장자리 근처를 가볍게 두드려 컵을 뒤집은 다음 열린 왼쪽 그립퍼에 끼웁니다.
이 넛지 단계는 높은 정밀도와 시각적 인식의 고리를 닫아야 합니다.
그런 다음 왼쪽 그립퍼를 부드럽게 닫고 컵을 테이블에서 들어 올린 다음 오른손 손가락으로 뚜껑을 살짝 열어 뚜껑을 놓치거나 컵이 손상되지 않도록 정밀도가 필요합니다.

Thread Velcro의 목표는 벨크로 케이블 타이의 한쪽 끝을 다른 쪽 끝에 부착된 작은 고리에 삽입하는 것입니다.
왼쪽 그리퍼는 먼저 테이블에서 벨크로 타이를 집어 들고, 오른쪽 그리퍼는 공중에서 타이의 꼬리를 꼬집어야 합니다.
그런 다음 양쪽 팔을 조정하여 벨크로 타이의 한쪽 끝을 공중에서 다른 쪽 끝에 삽입합니다.
루프의 크기는 3mm x 25mm이고 벨크로 타이의 크기는 위치에 따라 2mm x 10-25mm입니다.
이 작업이 성공하려면 로봇이 시각적 피드백을 사용하여 각 그립의 교란을 보정해야 합니다, 첫 번째 그립 도중 몇 밀리미터의 오차라도 두 번째 그립 공중에서 발생하여 삽입 단계에 10밀리미터 이상의 편차가 발생하기 때문입니다.

Prep Tape의 목표는 작은 부분의 테이프를 골판지 상자 가장자리에 거는 것입니다.
오른쪽 그립퍼는 먼저 테이프를 잡고 테이프 디스펜서의 칼날로 자른 다음 테이프 세그먼트를 공중에서 왼쪽 그립퍼에 전달합니다.
다음으로, 양쪽 팔이 상자에 접근하고, 왼쪽 팔은 테이프 부분을 상자 표면에 부드럽게 눕힌 다음, 오른쪽 손가락이 미끄러지지 않도록 테이프를 아래로 밀어냅니다. 그런 다음, 왼쪽 팔은 그립퍼를 열어 테이프를 놓습니다.
스레드 벨크로와 마찬가지로 이 작업은 두 팔 사이에 여러 단계의 섬세한 조정이 필요합니다.

Put On Shoe의 목표는 고정된 마네킹 발에 신발을 올려놓고 신발의 벨크로 스트랩으로 고정하는 것입니다.
팔은 먼저 신발의 혀와 칼라를 각각 잡고 들어 올려 발 쪽으로 다가가야 합니다.
신발을 신는 것은 꽉 끼는 착용감 때문에 어렵습니다:
팔은 발을 집어넣을 수 있도록 신중하게 조정해야 하며, 양말과 신발 사이의 마찰을 상쇄할 수 있을 만큼 양쪽 그립이 튼튼해야 합니다.
그런 다음 왼팔은 신발이 떨어지지 않도록 신발 바닥으로 이동한 다음 오른팔은 벨크로 스트랩을 뒤집고 신발에 눌러 고정합니다.
이 작업은 양쪽 팔이 풀린 후 신발이 발에 달라붙는 경우에만 성공한 것으로 간주됩니다.

시뮬레이션 작업인 Transfer Cube의 경우, 오른쪽 팔이 먼저 테이블 위에 놓여 있는 빨간색 큐브를 집어 들고 다른 팔의 그립퍼 안에 넣어야 합니다.
큐브와 왼쪽 그립퍼 사이의 작은 간격 (약 1cm)으로 인해 작은 오류로 인해 충돌 및 작업 실패가 발생할 수 있습니다.

시뮬레이션 작업인 Bimanual Insertion의 경우, 왼쪽 팔과 오른쪽 팔이 각각 소켓과 페그를 집어 들고 공중에 삽입하여 페그가 소켓 내부의 "핀"에 닿도록 해야 합니다.
삽입 단계에서 간격은 약 5mm입니다.
모든 8개의 작업에 대해 객체의 초기 배치는 15cm 흰색 기준선 (실제 작업)을 따라 무작위로 변경되거나 2D 영역 (시뮬레이션 작업)에서 균일하게 변경됩니다.
그림 6과 7의 초기 위치와 하위 작업에 대한 삽화를 제공합니다.
우리의 평가는 각 하위 작업에 대한 성과를 추가로 보고할 것입니다.

그림 7: 시뮬레이션 작업 정의. 두 개의 시뮬레이션 작업 각각에 대해 초기화와 하위 작업을 설명합니다.

이러한 작업을 해결하는 데 필요한 섬세한 이중 수동 제어 외에도, 우리가 사용하는 객체들은 상당한 인식 도전 과제를 제시합니다.
예를 들어, 지퍼백은 대체로 투명하며 얇은 파란색 밀봉선이 있습니다.
가방의 주름과 내부의 반사 사탕 포장지는 무작위화 과정에서 달라질 수 있으며, 인식 시스템을 방해할 수 있습니다.
다른 투명하거나 반투명한 물체로는 테이프와 조미료 컵의 뚜껑과 본체가 모두 포함되어 있어 정확하게 인식하기 어렵고 depth 카메라에 적합하지 않습니다.
검은색 테이블 상판은 검은색 벨크로 케이블 타이와 검은색 테이프 디스펜서와 같은 많은 관심 대상과 낮은 대비를 이룹니다.
특히 위쪽에서 볼 때, 돌출된 면적이 작기 때문에 벨크로 타이의 위치를 파악하는 것이 어렵습니다.

 

B. Data Collection

6가지 실제 작업 모두에 대해 ALOHA 원격 조작을 사용하여 데모를 수집합니다.
각 에피소드는 작업의 복잡성에 따라 작업자가 수행하는 데 8-14초가 소요되며, 이는 제어 주파수 50Hz를 고려할 때 400-700시간 단계로 변환됩니다.
각 작업에 대해 50개의 데모를 기록하지만, Thread Velcro는 100개입니다.
따라서 데모의 총량은 각 작업에 대해 약 10~20분의 데이터를 제공하며, 초기화 및 원격 운영자 실수로 인해 월클럭 시간에는 30~60분이 소요됩니다.
두 가지 시뮬레이션 작업에 대해 두 가지 유형의 시연을 수집합니다: 하나는 정책이 작성된 유형이고, 다른 하나는 인간 데모가 있는 유형입니다.
시뮬레이션에서 원격 조작을 위해, 우리는 ALOHA의 "leader robots"을 사용하여 시뮬레이션된 로봇을 제어하고, 운영자는 모니터에서 환경의 실시간 렌더링을 확인합니다.
두 경우 모두 50개의 성공적인 데모를 기록합니다.

 

우리는 한 사람이 모든 데모를 수집하더라도 모든 인간 데모는 본질적으로 확률적이라는 점을 강조합니다.
테이프 세그먼트의 공중 핸드오버를 예로 들어 보겠습니다: 핸드오버의 정확한 위치는 각 에피소드마다 다릅니다.
인간은 동일한 위치에서 수행할 시각적 또는 촉각적 참조가 없습니다.
따라서 작업을 성공적으로 수행하려면 핸드오버 중에 두 그리퍼가 서로 충돌해서는 안 되며, 왼쪽 그리퍼는 항상 테이프를 잡을 수 있는 위치로 이동해야 하며, 이는 데모마다 다를 수 있습니다.

 

C. Experiment Results

우리는 ACT를 네 가지 이전 모방 학습 방법과 비교합니다.
BC-ConvMLP는 현재 이미지 관측을 합성곱 네트워크로 처리하는 가장 간단하면서도 널리 사용되는 베이스라인 [69, 26]으로, 출력 피쳐가 공동 위치와 연결되어 액션을 예측합니다.
BeT [49]는 또한 트랜스포머를 아키텍처로 활용하지만, 주요 차이점이 있습니다: (1) 액션 청킹 금지: 모델은 관찰 이력이 주어졌을 때 하나의 액션을 예측합니다. (2) 이미지 관찰은 별도로 학습된 frozen 시각 인코더에 의해 사전 처리됩니다.
즉, 인식과 제어 네트워크가 공동으로 최적화되지 않습니다.
RT-1 [7]은 고정된 길이의 과거 관측 기록에서 하나의 액션을 예측하는 또 다른 트랜스포머 기반 아키텍처입니다.

BeTRT-1은 모두 액션 공간을 이산화합니다: 출력은 이산 빈에 대한 범주형 분포이지만, BeT의 경우 빈 중심에서 연속적인 오프셋이 추가됩니다.
우리의 방법인 ACT는 대신 미세한 조작에 필요한 정밀도를 바탕으로 연속적인 액션을 직접 예측합니다.
마지막으로, VINN [42]은 테스트 시 데모에 접근할 수 있다고 가정하는 비모수적 방법입니다.
새로운 관측값이 주어지면 가장 유사한 시각적 피쳐를 가진 k개의 관측값을 검색하고 가중치가 있는 k-nearest-neighbors을 사용하여 액션을 반환합니다.
시각적 피쳐 추출기는 비지도 학습을 통해 데모 데이터를 기반으로 사전 학습된 ResNet입니다.
큐브 전송을 사용하여 이 네 가지 이전 방법의 하이퍼파라미터를 신중하게 조정합니다.
하이퍼파라미터에 대한 자세한 내용은 부록 D에 나와 있습니다.

표 I: 시뮬레이션 작업 2개와 실제 작업 2개의 성공률(%), 우리의 방법을 4개의 베이스라인과 비교합니다. 두 개의 시뮬레이션 작업에 대해, 우리는 각각 3개의 시드와 50개의 정책 평가를 통해 [스크립트 데이터를 사용한 학습 ❘ 인간 데이터를 사용한 학습]을 보고합니다. 실제 작업의 경우, 1개의 시드와 25개의 평가를 통해 인간 데이터를 활용한 학습을 보고합니다. 전반적으로 ACT는 이전 방법들을 크게 능가합니다.

이전 방법들과의 상세한 비교를 위해, 우리는 두 개의 시뮬레이션 작업과 두 개의 실제 작업에 대한 평균 성공률을 표 I에 보고합니다.
시뮬레이션 작업의 경우, 3개의 랜덤 시드에서 각각 50번의 시도를 통해 평균 성능을 얻었습니다.
스크립트 데이터 (분리 막대 왼쪽)와 사람 데이터 (분리 막대 오른쪽) 모두에서 성공률을 보고합니다.
실제 작업의 경우, 우리는 하나의 시드를 실행하고 25번의 시도로 평가합니다.
ACT는 모든 이전 방법들에 비해 가장 높은 성공률을 달성하며, 각 작업에서 두 번째로 우수한 알고리즘을 큰 차이로 능가합니다.
스크립트 또는 사람 데이터를 사용한 두 가지 시뮬레이션 작업에서 ACT는 성공률에서 이전 최고의 방법보다 59%, 49%, 29%, 20% 더 뛰어납니다.
이전 방법들은 처음 두 가지 하위 작업에서 진전을 이룰 수 있었지만, 최종 성공률은 여전히 30% 이하로 낮습니다.
슬라이드 지플록과 슬롯 배터리의 두 가지 실제 작업에서 ACT는 각각 88%와 96%의 최종 성공률을 달성했으며, 다른 방법들은 첫 번째 단계를 넘어서도 진전이 없습니다.
이전 방법들의 성능이 좋지 않은 이유는 데이터의 오류와 비마르코프적 액션을 복합화했기 때문이라고 생각합니다: 에피소드가 끝날 무렵 액션이 크게 저하되고 로봇은 특정 상태에서 무기한 정지할 수 있습니다.
ACT는 액션 청킹과 관련된 두 가지 문제를 모두 완화합니다.
하위섹션 VI-A에 있는 우리의 ablation은 또한 청킹이 통합될 때 이러한 이전 방법들을 크게 개선할 수 있음을 보여줍니다.
또한 시뮬레이션 작업에서 스크립트 데이터에서 사람 데이터로 전환할 때 모든 메서드의 성능이 저하되는 것을 확인할 수 있습니다: 인간 데모의 확률성과 멀티모달은 모방 학습을 훨씬 더 어렵게 만듭니다.

표 II: 나머지 세 가지 실제 작업의 성공률(%). 우리는 최고 성능의 베이스라인 BeT와만 비교합니다.

우리는 표 II에 남아 있는 세 가지 실제 작업의 성공률을 보고합니다.
이 작업들에 대해서는 지금까지 가장 높은 작업 성공률을 기록한 BeT와만 비교합니다.
우리의 방법인 ACT는 Cup Open에서 84%, Thread Velcro에서 20%, Prep Tape에서 64%, Put On Shoe에서 92%의 성공률을 기록하며, 이러한 어려운 작업에서 최종적인 성공을 거두지 못하는 BeT를 다시 한 번 능가합니다.
Thread Velcro에서 ACT의 성공률이 상대적으로 낮았으며, 첫 번째 단계에서의 성공률은 92%에서 최종 성공률은 20%로 매 단계마다 절반 정도 감소했습니다.
우리가 관찰하는 고장 모드는 1) 2단계에서 오른쪽 팔이 그리퍼를 너무 일찍 닫고 공중에서 케이블 타이의 꼬리를 잡지 못하며, 2) 3단계에서는 삽입이 충분히 정밀하지 않아 루프를 놓치는 경우입니다.
두 경우 모두 이미지 관측을 통해 케이블 타이의 정확한 위치를 파악하기는 어렵습니다:
검은색 케이블 타이와 배경 간의 대비가 낮고 케이블 타이는 이미지의 극히 일부만 차지합니다.
부록 B에 이미지 관찰 예시를 포함하고 있습니다.

 

 

 

Ⅵ. Ablations

ACT는 복조 오류를 완화하고 비마르코프 데모를 더 잘 처리하기 위해 액션 청킹과 시간적 앙상블을 사용합니다.
또한 노이즈 인간 데모를 모델링하기 위해 정책을 conditional VAE로 학습합니다.
이 섹션에서는 ALOHA에서 고주파 제어의 필요성을 강조하는 사용자 연구와 함께 이러한 각 구성 요소를 ablate합니다.
우리는 총 네 가지 설정에서 결과를 보고합니다: 스크립트 또는 인간 데모가 포함된 두 가지 시뮬레이션 작업.

그림 8: (a) x축에는 청크 크기 k의 값이 다르고 y축에는 성공률이 다른 두 개의 베이스라인을 액션 청킹으로 보강합니다. 두 가지 방법 모두 액션 청킹에서 상당한 이점을 얻었으며, 이는 일반적으로 유용한 기술임을 시사합니다. (b) Temporal Ensemble (TE)은 VINN을 손상시키면서 우리의 방법과 BC-ConvMLP를 개선합니다. (c) 우리는 CVAE 학습과 그렇지 않은 경우를 비교하여, 인간 데이터로부터 학습할 때 중요하다는 것을 보여줍니다. (d) 우리는 참가자들이 두 가지 작업을 수행하도록 작업하는 사용자 연구에서 작업 완료 시간의 분포를 5Hz 또는 50Hz 원격 작동 주파수로 표시합니다. 주파수를 낮추면 완료 시간이 62% 느려집니다.

A. Action Chunking and Temporal Ensembling

하위섹션 V-C에서 우리는 ACT가 단일 단계 액션만을 예측하는 이전 방법들을 크게 능가한다는 것을 관찰했으며, 액션 청킹이 주요 설계 선택이라는 가설을 세웠습니다.
k가 각 "chunk"의 시퀀스 길이를 결정하기 때문에, 우리는 k를 변화시켜 이 가설을 분석할 수 있습니다.
k = 1은 액션 청킹이 없음에 해당하고, k = episode_length는 로봇이 첫 번째 관찰을 바탕으로 전체 에피소드의 액션 시퀀스를 출력하는 완전 개방 루프 제어에 해당합니다.
우리는 이 실험들에서 시간적 앙상블을 비활성화하여 청킹의 효과만을 측정하고, 각 k에 대해 별도의 정책을 학습시켰습니다.
그림 8 (a)에서 우리는 4개의 설정에서 평균 성공률을 보여줍니다, 이는 인간 또는 스크립트 데이터를 사용하는 2개의 시뮬레이션 작업에 해당하며, 파란색 선은 시간적 앙상블이 없는 ACT를 나타냅니다.
성능이 k = 100에서 k = 1%에서 44%로 급격히 향상된 후, 더 높은 k로 갈수록 약간 감소하는 것을 관찰했습니다.
이는 더 많은 청킹과 낮은 유효 지평선이 일반적으로 성능을 향상시킨다는 것을 보여줍니다.
k = 200, 400 (즉, 개방 루프 제어에 가까운)에서의 약간의 하락은 반응적 액션의 부족과 긴 액션 시퀀스를 모델링하는 데 어려움이 있기 때문이라고 생각합니다.
액션 청킹의 효과와 일반성을 더욱 평가하기 위해 액션 청킹을 사용하는 두 가지 기본 방법을 보강합니다.
BC-ConvMLP의 경우 출력 차원을 단순히 k*action_dim으로 증가시키고, VINN의 경우 다음 k개의 액션을 가져옵니다.

우리는 그림 8 (a)에서 서로 다른 k로 그들의 성능을 시각화하여, 더 많은 액션 청킹이 성능을 향상시키는 ACT와 일치하는 경향을 보여줍니다.
ACT는 여전히 두 가지 증강 베이스라인을 모두 능가하며 상당한 이득을 얻었지만, 이러한 결과는 액션 청킹이 이러한 환경에서 모방 학습에 일반적으로 유익하다는 것을 시사합니다.

 

그런 다음 앞서 언급한 4개의 작업과 다른 k에 걸쳐 가장 높은 성공률을 비교하여 시간적 앙상블을 제거합니다.
시간적 앙상블이 있는 실험과 없는 실험은 별도로 조정된다는 점에 유의합니다:
시간적 앙상블이 없을 때 가장 잘 작동하는 하이퍼파라미터는 시간적 앙상블에 최적이 아닐 수 있습니다.
그림 8 (b)에서 우리는 BC-ConvMLP가 시간적 앙상블로부터 4%의 이득을 얻었으며, 그 다음으로 우리의 방법이 3.3%의 이득을 얻는다는 것을 보여줍니다.
비모수적 방법인 VINN의 성능 저하를 확인했습니다.
우리는 시간적 앙상블이 모델링 오류를 완화함으로써 대부분 매개변수 방법에 도움이 된다고 가정합니다.
반면, VINN은 데이터셋에서 ground-truth 액션을 검색하며 이 문제를 겪지 않습니다.

 

B. Training with CVAE

우리는 노이즈가 많고 멀티모달 액션을 포함할 수 있는 인간 데모를 모델링하기 위해 CVAE objective로 ACT를 학습합니다.
이 섹션에서는 현재 관찰된 일련의 액션을 단순히 예측하고 L1 loss로 학습하는 CVAE objective가 없는 ACT와 비교합니다.
그림 8(c)에서는 두 개의 시뮬레이션 작업에서 집계된 성공률을 시각화하고, 스크립트 데이터와 인간 데이터를 사용한 학습을 별도로 그래프로 표시합니다.
스크립트 데이터를 학습할 때, CVAE objective를 제거해도 성능에 거의 차이가 없다는 것을 알 수 있습니다, 왜냐하면 데이터셋은 완전히 결정론적이기 때문입니다.
인간 데이터의 경우 35.3%에서 2%로 크게 감소했습니다.
이는 인간 데모를 통해 학습할 때 CVAE objective가 매우 중요하다는 것을 보여줍니다.

 

C. Is High-Frequency Necessary?

마지막으로, 미세 조작을 위한 고주파 원격 조작의 필요성을 설명하기 위해 사용자 연구를 수행합니다.
동일한 하드웨어 설정으로, 우리는 주파수를 50Hz에서 5Hz로 낮췄습니다, 이는 모방 학습을 위해 고용량 딥 네트워크를 사용하는 최근 연구들과 유사합니다 [7, 70].
우리는 두 가지 세밀한 작업을 선택합니다: 지퍼 케이블 타이와 플라스틱 컵 두 개의 stacking 풀기.
둘 다 밀리미터 수준의 정밀도와 폐루프 시각 피드백이 필요합니다.
우리는 원격 조작 경험이 다양한 6명의 참가자를 대상으로 연구를 수행했습니다, 하지만 이전에는 ALOHA를 사용한 적이 없었습니다.
참가자들은 컴퓨터 과학 대학원생들 중에서 모집되었으며, 22세에서 25세 사이의 남성 4명과 여성 2명이었습니다.

각 참가자의 과제 순서와 빈도는 랜덤으로 결정되었으며, 각 참가자에게는 각 시험 전에 2분간의 연습 시간이 제공되었습니다.
우리는 작업을 수행하는 데 걸린 시간을 3번의 시도로 기록하고, 데이터를 그림 8 (d)에 시각화했습니다.
평균적으로 참가자들이 지퍼 타이를 5Hz로 묶는 데 33초가 걸렸고, 50Hz에서는 20초로 낮아졌습니다.
플라스틱 컵을 분리할 때, 제어 빈도를 높이면 작업 시간이 16초에서 10초로 단축되었습니다.
전반적으로, 우리의 설정(즉, 50Hz)은 참가자들이 짧은 시간 안에 매우 능숙하고 정밀한 작업을 수행할 수 있게 해줍니다.
그러나 주파수를 50Hz에서 5Hz로 줄이면 원격 작동 시간이 62% 증가합니다.
그런 다음 통계 절차인 "Repeated Measures Designs"를 사용하여 50Hz 원격 작동이 p-값 <0.001로 5Hz보다 우수하다는 것을 공식적으로 확인합니다.
연구에 대한 자세한 내용은 부록 E에 포함되어 있습니다.

 

 

 

Ⅶ. Limitations and Conclusion

우리는 원격 조작 시스템 ALOHA와 새로운 모방 학습 알고리즘 ACT로 구성된 저비용 미세 조작 시스템을 소개합니다.
이 두 부분의 시너지 덕분에 반투명 조미료 컵을 열고 80~90%의 성공률과 약 10분간의 데모를 통해 배터리 슬롯을 채우는 등 실제 세계에서 직접 미세한 조작 기술을 배울 수 있습니다.
시스템은 꽤 유능하지만, 드레스 셔츠 단추를 채우는 것과 같은 로봇이나 학습 알고리즘의 능력을 넘어서는 작업들이 존재합니다.
부록 F에 제한 사항에 대한 더 자세한 논의가 포함되어 있습니다.
전반적으로, 우리는 이 저비용 오픈 소스 시스템이 세밀한 로봇 조작을 발전시키기 위한 중요한 단계이자 접근 가능한 자원이 되기를 바랍니다.