虎嗅

**과대평가된 시각·촉각 기술: 쉽게 복제할 수 있는 사업, 과연 얼마나 큰 투자 가치가 있을까?** (Overestimated visual and tactile technologies: How valuable is a business that can be easily replicated?)

原文:被高估的视触觉:容易复制的生意,能有多大投资价值?

핵심 내용 요약

시각-촉각 센서(VBTS, Visual-Tactile Sensors)는 현재 신체 기반 인공지능 분야의 촉각 기술에서 주목받고 있는 방향이지만, 본질적으로는 “시각 기술의 종속물”에 불과합니다. 기존의 시각 하드웨어와 알고리즘에 의존하며 독자적인 핵심 기술이 부족하기 때문입니다. 원리와 하드웨어 구조의 본질적인 한계로 인해 산업 현장에서 사용할 때 크기가 크고, 손상되기 쉽으며, 힘을 정확하게 감지하는 능력이 부족하고, 계산 자원의 소모가 많다는 문제가 있어 신체 기반 인공지능의 대규모 응용에 필요한 안정성, 신뢰성, 확장성을 충족시킬 수 없으며, 산업 수준의 촉각 감지 인프라로 자리잡기 어렵습니다.

1. 학계에서는 활발하지만 산업계에서는 “공허함”: 핵심 기술이 없어 “도용”에 의존

시각-촉각 센서의 인기는 사실 시각 기술의 이점을 빌려온 것입니다:

  • 하드웨어의 “조립”: 핵심 부품(예: CMOS 카메라)은 모두 구입한 것으로, 스타트업들은 단순히 카메라, 엘라스틱 재료, 광원을 조합할 뿐 자체적인 기술이 없습니다. 대학생들도 쉽게 프로토타입을 만들 수 있어 하드웨어의 진입 장벽이 매우 낮으며, 수십 개의 회사가 만든 제품들이 거의 동일하여 동질화가 심각합니다.
  • 알고리즘의 “복제”: 연구에 사용되는 알고리즘(예: ResNet, U-Net)은 시각 분야에서 그대로 가져온 것으로 촉각의 물리적 특성에 맞게 독자적으로 개선되지 않았습니다. 논문은 많이 발표되지만 촉각 감지의 핵심 문제를 해결하지 못합니다.
  • 자본의 부정적인 시각: 핵심 기술이 없어 공급망에 의존하며, 비즈니스 모델이 쉽게 복제될 수 있어 자본은 위험이 높다고 보기 때문에 이러한 “조립형 혁신”은 경쟁 우위가 없으며, 수익도 적어 업계 표준이 될 수 없습니다.

2. 하드웨어의 본질적인 약점: 크기가 크고, 손상되기 쉽으며, 계산 자원을 많이 소모함

시각-촉각 센서의 하드웨어 구조는 산업 현장에 적합하지 않습니다:

  • 크기 문제: 카메라의 최소 초점 거리로 인해 센서의 두께가 10mm를 넘어서며, 로봇 손가락 내부에는 모터와 감속기 등이 이미 있어 촉각 모듈을 많이 설치할 수 없습니다.
  • 엘라스틱 재료의 딜레마: 엘라스틱 재료가 부드러우면 민감도가 높지만 마모와 노화가 쉽고, 단단하면 변형이 작아 카메라가 세부 사항을 포착할 수 없어 민감도가 떨어집니다. 이는 해결하기 어려운 물리적 문제입니다.
  • 계산 자원의 부담: 로봇의 양손에 촉각 센서를 설치하면 수십 개의 카메라가 필요하며, 각 비디오 스트림을 처리하는 데 많은 계산 자원이 소모되어(예: 30개의 스트림에는 160TOPS 이상의 연산 성능이 필요하며, 별도의 서버가 필요함), 전력 소비가 많아 로봇이 견딜 수 없습니다. 또한 케이블이 너무 많아 손가락 끝의 직경이 몇 밀리미터에 불과하여 통과하기 어렵습니다.

3. 힘 감지의 정확성 문제: 원리상의 한계

촉각의 핵심은 힘을 측정하는 것이지만, 시각-촉각 센서는 “간접적으로 추정”하기 때문에 본질적으로 정확하지 않습니다:

  • 정보 손실: 3차원의 힘(예: 압력, 슬라이딩)을 2차원 이미지로 압축한 후 다시 추론하는 과정에서 정보가 부족하여 오류가 발생합니다. 예를 들어, 여러 지점에 동시에 접촉할 때 힘의 방향과 크기를 정확하게 측정할 수 없습니다.
  • 픽셀과 실제 감지 포인트의 불일치: 많은 제조업체가 “평방센티미터당 4만 개의 감지 단위”라고 주장하지만, 이는 카메라의 픽셀 수에 불과하며 실제로 유효한 감지 포인트는 몇 백 개에 불과하고 3차원 정보가 없습니다. 픽셀을 많이 쌓아도 소용없으며, 오히려 잡음만 증가합니다.
  • 동적 응답의 느림: 카메라의 프레임률은 30-60fps(초당 30-60장)에 불과하지만, 로봇이 물건을 잡을 때의 충격은 밀리초 단위이므로 캡처할 수 없습니다. 예를 들어, 계란을 잡을 때 충격이 순식간에 발생하지만 시각-촉각 센서가 반응하기 전에 이미 계란이 깨질 수 있습니다.

4. 산업 현장에서의 적용 어려움: 환경이 복잡해지면 “작동 중단”, 대규모 확장은 불가능

실제 산업 현장(기름, 고온, 진동)은 센서에 매우 높은 요구를 하지만 시각-촉각 센서는 이를 견딜 수 없습니다:

  • 환경적 영향: 기름이 엘라스틱 재료에 달라붙어 카메라가 제대로 촬영할 수 없으며, 온도 변화로 인해 엘라스틱 재료가 변형되고 광원의 성능이 저하되어 신호가 불안정해집니다. 예를 들어, 습한 환경에서는 수증기가 렌즈에 응축되어 촬영이 불가능해집니다.
  • 장기적인 신뢰성 문제: 엘라스틱 재료가 시간이 지남에 따라 노화되어 힘과 이미지의 매핑 관계가 변하며, 카메라가 계속 촬영해도 잘못된 신호를 출력합니다. 이는 신호가 없는 것보다 더 위험하며, 로봇이 잘못된 힘 정보에 따라 작동하여 제품이 손상되거나 사고가 발생할 수 있습니다.
  • 대규모 확장의 비용 문제: 촉각 센서 자체는 비싸지 않지만, 필요한 계산 자원과 배선 비용이 많이 듭니다. 예를 들어, 로봇에 30개의 센서를 설치하면 계산 자원과 전력 소비 비용이 센서 자체보다 높아 기업이 감당하기 어렵습니다.

결론

시각-촉각 센서는 실험실 연구나 교육용으로 적합하지만, 산업 수준의 촉각 인프라로는 부적합합니다. 신체 기반 인공지능이 실제로 활용되려면 안정적으로 힘을 측정하고, 내구성이 뛰어나며, 쉽게 통합할 수 있는 기술이 필요하지만 시각-촉각 센서는 원리부터 하드웨어까지 이러한 요구를 충족시키지 못합니다. 그 인기는 일시적인 것이며, 산업 현장에 더 적합한 기술에 의해 대체될 것입니다.