요 몇 년 AI 얘기는 거의 화면 안에서 끝났다. 글 쓰고, 코드 짜고, 그림 그리고. 그런데 요즘은 **피지컬 AI(Physical AI)**라는 말이 부쩍 자주 들린다. 카메라로 보고, 판단하고, 모터를 돌려서 실제 물건을 다루는 AI 말이다.
이번 주엔 그 흐름이 잘 보이는 소식이 두 개 겹쳤다. 알파벳(구글) 산하 로보틱스 조직 Intrinsic이 산업용 로봇 플랫폼의 핵심을 오픈소스로 풀었고, MIT의 곤충 크기 비행 로봇 연구가 다시 화제가 됐다. 하나는 로봇 소프트웨어 인프라, 하나는 AI 기반 제어 얘기라 층위는 다른데, 읽다 보니 결국 "로봇이 점점 소프트웨어 개발자 쪽으로 넘어오고 있다"는 같은 이야기로 들렸다.
Intrinsic Core, 공장에서 쓰던 걸 그대로 풀었다
Intrinsic은 2026년 9월 22일 캐나다 토론토에서 열린 ROSCon 2026에서 Intrinsic Core를 발표했다. 라이선스는 상업 이용과 수정이 자유로운 Apache 2.0이고, 코드는 GitHub intrinsic-ai/intrinsic-core 저장소에 있다.
회사는 이걸 "ROS 호환 기능들의 오픈소스 세트"라고 부른다. 내가 흥미롭게 본 건 데모용 샘플이 아니라 실제 제조 현장 배포에서 쓰던 기능과 서비스를 조립 가능한 블록으로 묶었다는 점이다. 공식 발표 기준 구성은 이렇다.
- Intrinsic Control: 특정 하드웨어에 묶이지 않는 실시간 제어 프레임워크
- 포즈 추정: NVIDIA FoundationPose를 활용한 6자유도 물체 위치·자세 인식
- 모션 플래닝(충돌 고려 경로 생성), 그래스프 플래닝(그리퍼로 어떻게 잡을지)
- Gazebo 기반 시뮬레이션 서비스, 카메라 캘리브레이션
- Intrinsic-ROS 드라이버: 일부 로봇·그리퍼·카메라용
같이 나온 OMTS(Open Machine Tending Solution)도 은근히 좋았다. CNC 공작기계에 소재를 넣고 빼는 머신 텐딩용 레퍼런스 디자인인데, FANUC과 Universal Robots 하드웨어를 지원하고 Intrinsic Core와 Open Robotics Suite 위에서 돈다. SDK만 던져준 게 아니라 "이렇게 조립하면 셀 하나가 실제로 돌아간다"는 완성 예제까지 준 셈이다.
The Robot Report 보도를 보면 CTO 브라이언 거키(Brian Gerkey)는 코드만 던지고 떠나는 게 아니라 커뮤니티에 대한 장기적인 약속이라고 강조했다. 그리고 지금 타깃은 ROS에 익숙한 개발자, 그중에서도 로봇 팔 기반 매니퓰레이션이고 모바일 로봇이나 휴머노이드는 주 대상이 아니라고 했다. 휴머노이드 기대하고 들어가면 실망할 수 있으니 이건 기억해두는 게 좋겠다.
오픈 플랫폼이 왜 반가운가
로봇 한 대를 실제로 일하게 만들려면 층이 생각보다 많다. 드라이버, 실시간 제어, 좌표계 변환, 인식, 경로 계획, 파지 계획, 시뮬레이션, 캘리브레이션까지 다 있어야 "상자 집어서 옮기기" 정도가 된다. 지금까진 이걸 회사마다 따로 만들거나 비싼 상용 솔루션에 기대야 했다.
그래서 모션 플래닝이나 캘리브레이션처럼 지루하지만 어려운 부분을 공통 기반으로 쓸 수 있다는 것만으로도 꽤 크다고 본다. 팀은 도메인 로직이나 AI 모델 같은 자기 문제에 집중하면 된다. ROS 호환이라 기존 노드·패키지·툴을 그대로 붙일 수 있는 것도 좋고, Apache 2.0은 특허 조항이 들어간 관대한 라이선스라 기업이 제품에 넣기도 편하다. 로보틱스 쪽에도 오픈소스인데 상업 사용이 애매한 경우가 적지 않았던 걸 생각하면 더 그렇다.
시장 쪽 숫자도 하나 있다. SiliconANGLE은 미국·유럽 가공 공장 중 자동화를 도입한 곳이 8%밖에 안 된다는 수치를 인용하면서 비용과 기술 장벽을 원인으로 꼽았다. 소프트웨어 기반이 열리면 중소 현장이나 시스템 통합 업체가 한번 시도해볼 여지가 생긴다.
개인적으로 제일 와닿은 건 이 부분이다. 로봇 파운데이션 모델이 아무리 좋아져도 결국 출력은 안전한 제어·계획 계층을 거쳐 모터로 가야 한다. Intrinsic Core 같은 스택은 AI 모델을 꽂을 표준 소켓 같은 역할을 할 것 같다. 웹으로 치면 회사마다 웹 서버를 직접 짜던 시절에서, 검증된 프레임워크 위에 앱을 올리는 시절로 넘어가는 느낌이다.
MIT 곤충 로봇: 무거운 계산은 밖에서, 가벼운 정책은 로봇 위에서
두 번째는 MIT의 곤충 크기 플래핑(날갯짓) 로봇이다. 연구 자체는 2025년 12월 Science Advances에 실렸고 MIT 뉴스로도 소개됐는데, 최근 ScienceDaily 등으로 다시 퍼지면서 화제가 됐다. 새 연구는 아니라는 점은 짚고 가자.
종이클립보다 가벼운 로봇이 부드러운 인공 근육으로 날개를 엄청 빠르게 퍼덕여서 난다. MIT 전기공학·컴퓨터과학과 케빈 첸(Kevin Chen) 교수 연구실과 항공우주공학과 조너선 하우(Jonathan P. How) 교수 팀이 같이 했다. 발표된 성과는 이렇다.
- 연구팀 이전 최고 기록 대비 속도 약 447%, 가속도 약 255% 향상
- 11초 동안 10회 연속 공중제비
- 바람 교란이 있어도 계획 경로에서 약 4~5cm 이내 유지
솔직히 숫자보다 더 눈에 들어온 건 제어 구조였다. 먼저 물리 모델로 최적 궤적을 계산하는 모델 예측 제어(MPC)가 있다. 강력하지만 계산이 무겁다. 그리고 이 MPC의 행동을 따라 하도록 모방 학습으로 훈련한 가벼운 신경망 정책이 실시간으로 로봇을 제어한다. 정확하지만 느린 선생을 두고 빠르고 가벼운 학생을 만들어 실전에 내보낸 거다. 하우 교수는 MIT 뉴스에서 강건한 학습 방법을 이 기법의 "secret sauce"라고 불렀다. LLM 쪽 지식 증류(distillation)랑 발상이 비슷해서 ML 해본 사람이면 금방 감이 올 것 같다.
한계도 분명하다. 지금은 외부 모션 캡처 시스템에 의존한다. 연구팀은 온보드 센서와 카메라를 달아 실외 자율 비행, 여러 대 협업 쪽으로 가려 하고, 장기적으로는 지진 잔해 수색처럼 일반 드론이 못 들어가는 공간이 응용처로 거론된다.
공장 로봇 팔과 초소형 비행체의 공통점
얼핏 공장 로봇 팔 소프트웨어와 연구실 초소형 비행체는 거리가 멀다. 그런데 둘 다 AI가 제어를 통째로 대체하는 그림이 아니다. MIT는 MPC에 학습 정책을 붙였고, Intrinsic Core는 FoundationPose 같은 학습 기반 인식 위에 모션·그래스프 플래닝을 얹었다. 검증된 제어 위에 AI를 얹는 쪽이 현실적인 방향이라는 게 두 사례에서 똑같이 보인다.
또 하나는 시뮬레이션과 데이터다. 학습 정책을 만들려면 시뮬레이션이나 전문가 시연 데이터가 있어야 하고, Intrinsic Core가 Gazebo 기반 시뮬레이션을 기본으로 넣은 것도 같은 맥락으로 읽힌다. 결국 로봇의 차별점이 하드웨어보다 소프트웨어 스택과 모델에서 나오는 쪽으로 가고 있고, 그만큼 소프트웨어 개발자가 할 일이 늘어난다는 얘기다.
로봇 없이 시작해본다면
로봇이 없어도 된다. 대부분의 학습은 시뮬레이터와 노트북에서 한다. 내가 지금 시작한다면 이 순서로 갈 것 같다.
먼저 ROS 2. 2026년 5월에 나온 최신 LTS인 ROS 2 Lyrical Luth(2031년 5월까지 지원 예정)나 이전 LTS인 Jazzy면 무난하다. 노드, 토픽, 서비스, 액션, 파라미터, TF(좌표 변환) 개념부터 잡으면 되는데, 백엔드 개발자라면 "pub/sub 메시지 버스 위의 마이크로서비스"로 생각하면 빨리 들어온다. Python(rclpy)으로 시작해서 성능이 필요한 부분만 C++(rclcpp)로 옮기는 게 부담이 적다.
다음은 시뮬레이션이다. Gazebo에 가상 로봇 팔이나 모바일 로봇을 띄우고 ROS 2 노드로 움직여본다. 이번에 나온 Intrinsic Core 저장소와 OMTS 레퍼런스 디자인을 따라가 보면 실제 산업용 셀이 어떤 부품으로 구성되는지 구조를 보기 좋을 것 같다. 시뮬레이션과 현실의 차이(sim-to-real gap)는 로보틱스에서 제일 중요한 주제 중 하나라 처음부터 의식해두는 게 좋다.
그다음 로봇 학습. Hugging Face의 LeRobot은 데이터 수집부터 정책 학습, 배포까지 다루는 오픈소스 라이브러리다. 여기 생태계의 SmolVLA는 약 5억(0.5B) 파라미터 VLA(Vision-Language-Action) 모델이고 Apache 2.0으로 공개돼 있다. 카메라 이미지와 자연어 지시를 받아 로봇 행동을 내놓는 구조라 "LLM 다음은 VLA"라는 흐름을 직접 만져볼 수 있다. 파인튜닝은 대략 이런 모양으로 시작한다(세부 옵션은 공식 문서 참고).
lerobot-train \
--dataset.repo_id=<your-hf-user>/<dataset> \
--policy.path=lerobot/smolvla_base \
--output_dir=./outputs/my_run \
--batch_size=4제어 이론도 조금은 보충해두자. MIT 사례처럼 최신 연구도 MPC 같은 고전 제어가 바탕이라 PID, 상태 공간 모델, MPC 개념 정도만 알아도 논문과 코드 읽는 속도가 확 달라진다. ML 쪽 사람이라면 모방 학습(behavior cloning)과 강화 학습의 차이부터 정리해보는 걸 추천한다.
그리고 실물로 넘어갈 땐 안전이 먼저다. 화면 속 버그는 재시작하면 끝이지만 로봇 팔 버그는 사람을 다치게 할 수 있다. 속도 제한, 비상 정지, 작업 영역 제한부터 걸어두자. 저렴한 입문용 로봇 팔 키트나 중고 협동로봇으로 감을 익히되 실험은 늘 시뮬레이션에서 먼저 돌려보는 습관이 좋다. 최신 동향은 ROSCon 발표 영상, ROS Discourse, 각 프로젝트 GitHub 이슈에서 보는 게 제일 빠르다.
개인적인 생각
Intrinsic Core는 공장에서 검증된 블록을 누구나 쓸 수 있게 됐다는 점에서, MIT 로봇은 무거운 최적화 제어를 가벼운 정책으로 증류해서 극한 환경에서 돌렸다는 점에서 각각 재밌었다.
피지컬 AI는 아직 초기라 당장 다들 로봇 회사로 갈 필요는 없다고 본다. 그래도 ROS, 시뮬레이션, VLA 모델 정도는 앞으로 몇 년 AI가 어디로 뻗어가는지 이해하는 데 필요한 기초가 될 가능성이 크다. 나도 이번 주말엔 Gazebo에 가상 로봇 팔 하나 띄워볼 생각이다.
참고한 글
- Introducing Intrinsic Core: An open source approach to Physical AI (Intrinsic) — 공식 발표. 구성 요소와 OMTS 소개
- intrinsic-ai/intrinsic-core (GitHub) — 소스 코드 저장소
- Intrinsic open sources key parts of its platform for easier development (The Robot Report) — CTO 인터뷰, 타깃 사용자 얘기
- Google's robotics unit Intrinsic open-sources its foundational infrastructure for intelligent robots (SiliconANGLE) — Intrinsic 연혁과 제조 자동화 시장 맥락
- MIT engineers design an aerial microrobot that can fly as fast as a bumblebee (MIT EECS) — MIT 원문 보도. MPC와 모방 학습 구조 설명
- MIT's tiny flying robot gets 450% faster with AI (ScienceDaily) — 성능 수치와 Science Advances 논문 정보(DOI 10.1126/sciadv.aea8716)
- Robot Operating System (Wikipedia) — ROS 2 배포판(Lyrical Luth, Jazzy) 일정
- lerobot/smolvla_base (Hugging Face) — SmolVLA 모델 카드. 파라미터 규모, 라이선스, 파인튜닝 방법