연구노트

멀티모달 담론의 세 가지 오해

5호 · 채널의 수는 경험의 질을 보증하지 않습니다

2026.09.23 | 조회 32 |
0
|

1.뉴스

2026년 9월 17일, 미국의 로봇 회사 Figure가 새 모델 Helix 2.5를 공개했습니다. 베이 에어리어의 주택 서른 곳에 로봇을 들여보내 장난감을 주워 담고 침대를 정돈하고 수건을 접게 했습니다. 그 서른 곳에서는 데이터를 한 건도 모으지 않았습니다.

로봇 학습에서는 보통 일할 장소에서 먼저 데이터를 모아 그 장소에 맞춰 학습시킵니다. 같은 회사의 직전 공개도 평가할 환경에서 직접 모은 데이터로 학습한 것이었습니다. 이번 발표는 그 과정을 건너뛰었습니다. 한 번도 데이터를 모으지 않은 집에 로봇을 바로 들여보내 그대로 일을 시켰고, 이것을 제로샷이라고 부릅니다.

발표에 적힌 조건을 고정한 것과 바꾼 것으로 정리하면 이렇습니다. 고정한 것은 로봇의 몸, 과업별 체크포인트, 그리고 성공 판정 기준입니다. 바꾼 것은 둘입니다. 평가 장소를 데이터가 없는 남의 집으로 옮긴 것이 하나, 비교 대상인 두 정책의 학습 이력을 다르게 둔 것이 둘입니다.

판정 기준은 이렇습니다. 일을 전부 끝낸 경우만 성공으로 세고 부분 점수는 없습니다. 장난감은 열세 개에서 열다섯 개 전량이며 하나당 1분, 수건은 네 귀가 1인치 이내이며 하나당 3분, 베개는 침대 상단 3분의 1 지점에 15도 이내, 이불 두 귀의 차이는 6인치 이내입니다.

결과는 두 수로 나왔습니다. 구조와 최적화와 하이퍼파라미터와 과업 데이터와 평가를 모두 같게 두고 초기 가중치만 달리했을 때, 무작위 초기화 쪽은 9퍼센트, 대규모 사전학습을 거친 쪽은 56퍼센트에서 성공했습니다.

 

2.회사가 내린 결론

회사의 결론은 원인 지목입니다. 원문은 “Index pretraining alone increased zero-shot success from 9% to 56%”입니다. 일반화를 만든 것은 몸도 아니고 현장 데이터도 아니고 사전학습이라는 주장입니다.

기준선도 회사가 직접 적었습니다. 원문은 “This is currently not true for robots. They learn the places they work in, one place at a time”입니다. 로봇은 지금까지 일할 장소를 한 곳씩 배워 왔고 이번에는 그렇지 않다는 대비입니다.

부수 발견으로 자기 교정을 들었습니다. 뒤로 물러서 자세를 바꾸고 침대를 한 바퀴 돌아 접힘을 다시 잡는 행동이며, 회사는 이것을 사전학습의 중요한 효과로 적었습니다. 그리고 단서를 하나 붙였습니다. 원문은 “The point is not that general humanoid robotics is solved”입니다.

회사가 직접 적지는 않았으나 이 결론이 겨냥하는 곳은 성능 순위가 아니라 비용 구조입니다. 장소마다 데이터를 모아야 한다면 비용은 장소의 수만큼 늘어납니다. 그 과정을 건너뛸 수 있다면 다음 투입은 집마다가 아니라 학습 한 번에 몰립니다. 공장이 아니라 남의 집 서른 곳을 골랐다는 사실 자체가 배치 대상의 선언입니다.

 

3.같은 사태를 네 층위로 다시 세운 표

M4는 경험을 네 자리로 나눕니다. 감각과 표현의 자원이 Mode입니다. 그 자원에 붙는 조건과 태도가 Modal입니다. 둘이 결합해 성립하는 총체적 경험 구조가 Modality입니다. 그리고 그 구조가 놓이는 시대적이고 기술적인 환경이 Medium입니다. 넷은 아래에서 위로 쌓이는 사다리가 아니고 서로를 되돌려 받는 순환입니다. Medium은 Mode와 Modal이 가질 수 있는 범위를 정하고, Mode와 Modal이 결합해 Modality를 만들며, 그렇게 만들어진 Modality는 다시 Medium을 바꾸라고 요구합니다.

첨부 이미지

표에서 드러나는 것은 자원과 부과된 조건을 붙들어 놓은 상태에서 환경과 총체 쪽에서 사태가 일어났다는 점입니다. 그리고 회사는 네 자리 중 셋을 정리한 뒤 원인을 하나로 모았습니다. 몸은 변수에서 빼고, 기준은 엄격함의 근거로 쓰고, 환경은 난점으로 돌리고, 원인은 사전학습에 두었습니다.

여기서 세 가지 오해가 갈라집니다. 오해는 누가 틀린 말을 했다는 뜻이 아닙니다. 네 자리를 한 이름으로 부를 때 생기는 시야의 손실입니다.

 

4.첫 번째 오해 · 자원의 수가 경험의 질을 만든다

감각을 받아들이는 통로를 늘리면 경험이 나아진다는 전제는 멀티모달 담론의 기본 설정입니다. 이번 실험은 그 전제를 검사할 조건을 우연히 갖추었습니다. 두 정책은 같은 몸을 썼습니다. 카메라의 수도 팔의 수도 다리의 수도 같았고, 서른 집 전부에서 한 번도 달라지지 않았습니다.

자원을 하나도 늘리지 않은 상태에서 성립 정도가 여섯 배 이상 갈렸습니다. 그러므로 이 실험에서 질을 만든 것은 자원의 가짓수가 아닙니다.

표현 자원과 그것이 실현되는 매체를 갈라야 한다는 지적은 멀티모달 연구의 초기부터 있었습니다(Kress & van Leeuwen 2001). 분석의 단위를 개별 자원이 아니라 상호작용 전체에 두어야 한다는 제안도 함께 있었습니다(Norris 2004). 그럼에도 실무의 문서에서 그 구별이 유지되지 않는 이유는 네 자리가 한 단어를 공유하고 있기 때문입니다.

 

5.두 번째 오해 · 성능 수치는 관찰된 사실이다

9퍼센트와 56퍼센트는 측정된 값이지만 관찰된 값은 아닙니다. 두 수는 여섯 겹으로 걸린 조건 아래에서만 존재합니다.

첨부 이미지

수건의 허용 오차를 2인치로 바꾸면 다른 수가 나옵니다. 부분 점수를 인정하면 또 다른 수가 나옵니다. Modal은 수치가 산출되는 배경이 아니라 수치를 생산하는 항목입니다.

 

6.세 번째 오해 · 결과의 원인은 한 항목으로 지목된다

Modality를 한 칸에 두면 원인이 하나로 모입니다. 다섯 겹으로 나누면 겹마다 원인이 달라집니다.

첨부 이미지

지정하지 않은 행동이 나타났다는 사실이 이 절의 근거입니다. 성립이 항목의 합으로 계산된다면 목록에 없던 것은 나올 수 없습니다.

 

7.이력의 자리

겪어 온 것은 별도의 자리가 아닙니다. Modal의 정의는 Mode에 붙는 조건과 태도이며, 그 조건과 태도가 어떤 재료로 만들어졌는지는 정의에 들어 있지 않습니다. 그러므로 사람의 습관과 기계의 학습 이력이 같은 것이라고 말할 필요는 없습니다. 둘이 같은 자리를 채운다고만 말하면 됩니다.

그 자리에 놓이기 위한 요건은 셋입니다. 첫째, 사태 이전에 형성되어 있어야 합니다. 둘째, 지금의 수행에 성향으로 작용해야 합니다. 셋째, 그 자리에서 부과된 조건과 따로 변할 수 있어야 합니다.

이번 실험은 세 번째 요건을 직접 보여 줍니다. 부과된 조건을 전부 같게 고정한 상태에서 학습 이력만 달랐고 결과가 갈렸습니다. 두 항목이 서로 독립적으로 변한다는 사실이 확인되었으므로 하나의 조건 묶음으로 뭉뚱그릴 수 없습니다.

이력이 이 자리에 들어오는 경로는 앞에서 적은 순환으로 설명됩니다. 한 번 성립한 Modality는 그 자리에서 사라지지 않고 다음 수행의 조건 쪽에 남습니다. 이번 사례에서 사전학습은 다른 곳에서 성립했던 수행들이 성향으로 굳어 남은 것이고, 그 성향이 남의 집이라는 새 환경에서 다시 입력으로 들어왔습니다. 그러므로 새 자리를 만들 필요가 없고, 순환의 한 국면으로 기술하면 됩니다.

퍼스는 습관의 형성을 기호 작용이 귀착하는 자리로 보았고(Peirce 1931-1958), 가다머는 이해가 언제나 선이해와 역사성 안에서 일어난다고 했습니다(Gadamer 1975). 두 논의가 다루는 것은 사람의 경우입니다. 기계로 넓히는 근거는 그 논의가 아니라 위의 세 요건입니다.

첨부 이미지

같은 자리에 놓인다고 해서 같은 성질은 아닙니다. 차이는 셋입니다. 첫째는 접근입니다. 사람은 자기 습관을 부분적으로 자각하지만 로봇은 자기 가중치를 열어 볼 수 없습니다. 둘째는 수정 경로입니다. 사람은 수행을 되풀이해 습관을 바꾸지만 가중치는 외부의 재학습으로만 바뀝니다. 셋째는 귀속입니다. 사람의 습관은 그 사람의 이력이지만 기계의 성향은 데이터를 모은 사람과 학습을 돌린 사람의 이력입니다.

세 번째 차이가 실무에서 가장 무겁습니다. 기계가 남의 집에서 어떤 성향으로 움직이는지는 그 집의 사정이 아니라 다른 곳에서 모인 이력이 정합니다. 성향의 책임이 사용 현장 밖에 있다는 뜻입니다.

이 구분을 넣으면 두 정책의 차이가 하나로 정리됩니다. 몸이 같고 집이 같고 부과된 조건이 같은 상태에서 퇴적된 Modal만 달랐습니다. 회사가 일반화 능력이라고 부른 것은 태도가 굳는 과정입니다.

자기 교정이 목록 밖에서 나온 이유도 같은 자리에서 설명됩니다. 굳은 성향은 지정된 항목만 낳지 않고 지정되지 않은 행동까지 함께 낳습니다. 습관이 원래 그렇습니다.

 

8.아직 말할 수 없는 것

공개되지 않은 것이 넷입니다. 총 시행 횟수, 과업별 성공률, 서른 곳의 선정 기준과 주택 유형 분포, 그리고 사람의 개입 조건입니다. 전부 회사 자체 보고이며 제삼자 검증이나 외부 재현은 없습니다.

이론 쪽에도 미결이 둘 있습니다. 퇴적된 Modal을 외부에서 읽을 방법이 없습니다. 가중치는 공개되지 않고 성향을 기술할 지표도 없으므로 지금은 결과로 역산하는 길뿐입니다. 그리고 접근과 수정과 귀속의 세 차이를 Modal 안에서 어떻게 표기할지가 남아 있습니다. 같은 자리를 채우는 두 실현을 구분해 두기는 했으나, 그 구분이 분석 절차에서 어떤 단계로 들어가는지는 아직 정하지 않았습니다.

논지가 약해지는 조건도 적어 둡니다. 판정 기준을 크게 바꾸어도 수치가 비슷하게 유지되고 환경을 바꾸어도 차이가 나타나지 않는다면, 네 자리를 갈라 세워야 한다는 이 글의 논지는 그만큼 힘을 잃습니다.

 

다음 회차에서는 감각이 여러 갈래로 들어올 때 그것이 하나의 지각으로 묶이는 과정을 다룹니다. 보는 것이 듣는 것을 바꾸어 버리는 현상에서 시작하겠습니다.

 

참고문헌

Gadamer, H.-G. (1975). Truth and Method. Seabury Press.

Kress, G., & van Leeuwen, T. (2001). Multimodal Discourse: The Modes and Media of Contemporary Communication. Arnold.

Norris, S. (2004). Analyzing Multimodal Interaction: A Methodological Framework. Routledge.

Peirce, C. S. (1931-1958). Collected Papers of Charles Sanders Peirce. Harvard University Press.

 

출처

Figure, 「Helix 2.5: Zero-Shot 30-Home Generalization」, 2026-09-17. https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization

Figure 공식 계정 발표, 2026-09-17. https://x.com/Figure_robot/status/2100657350952779925

Figure 공개 목록. https://www.figure.ai/news

모달리티 연구노트는 모달리티연구소(Modality Lab)가 발행하는 연구 노트입니다.

연구소 웹사이트 https://modalitylab.org

문의 contact@modalitylab.org

이 뉴스레터가 유익했다면 주변의 한 사람에게 전해 주십시오.

다가올 뉴스레터가 궁금하신가요?

지금 구독해서 새로운 레터를 받아보세요

✉️

이번 뉴스레터 어떠셨나요?

모달리티 연구노트 님에게 ☕️ 커피와 ✉️ 쪽지를 보내보세요!

댓글

의견을 남겨주세요

확인
의견이 있으신가요? 제일 먼저 댓글을 달아보세요 !

다른 뉴스레터

© 2026 모달리티연구소 Modality Lab

인간과 AI가 함께 만드는 경험의 구조를 읽는 모달리티연구소의 연구 노트입니다.

뉴스레터 문의contact@modalitylab.org

메일리 로고

도움말 오류 및 기능 관련 제보

서비스 이용 문의admin@team.maily.so 채팅으로 문의하기

메일리 사업자 정보

메일리 (대표자: 이한결) | 사업자번호: 717-47-00705 | 서울특별시 송파구 위례광장로 199, 5층 501-2-31호

이용약관 | 개인정보처리방침 | 정기결제 이용약관 | 라이선스