2010년 12월 15일
우리는 심문이 로봇 스타일러스를 들고 또 다른 당사자 (인간 또는 인공)의 상호 작용되는 telerobotic 시스템을 통해 실시 튜링 같은 악수 테스트를 제시한다. 우리는 강제 선택 방식을 사용하고 인간의 악수하는 인공 모델의 유사성에 대한 측정의 압축을 풉니다.
본 절차의 전반적인 목적은 악수 컴퓨터 모델이 실제 사람의 악수와 얼마나 유사한지를 결정하는 것입니다. 이를 위해 먼저 피험자에게 사람의 악수, 컴퓨터가 생성한 악수, 또는 텔레로봇 인터페이스를 이용한 두 가지의 조합으로 구성된 악수 쌍을 제시합니다. 절차의 두 번째 단계에서는 각 피험자에게 각 쌍 중에서 어떤 악수가 더 사람과 유사한지 선택하도록 요청합니다.
절차의 마지막 단계는 피험자의 답변을 통해 악수 모델의 인간 유사도 등급, 즉 모델 인간 유사도 등급(MHLG)을 계산하는 것입니다. 결과적으로, 튜링 유사 악수 테스트를 이용한 MHLG를 통해 서로 다른 모델 간의 유의미한 차이를 보여주는 결과를 얻을 수 있습니다. 사실 튜링 테스트는 언어적 지능에 국한되어 있으며, 과학자들과 엔지니어들은 운동 행동의 운동 제어 측면에서 인공 지능과 자연 지능 사이에 큰 격차가 있음을 관찰하였습니다.
많은 과학자들이 튜링 테스트의 운동 버전(motor version)에 대해 생각해 왔으나, 최근에 이르러서야 연구실에서 구동 가능한 로봇 장치들이 보급되었으며, 이를 통해 튜링 테스트와 유사한 악수 테스트를 위한 단순하고 재현 가능한 프로토콜의 구현이 가능해졌습니다. 이 방법은 자연스러운 인간의 촉각 경험을 제공하는 인간 팔 움직임의 핵심 특징은 무엇인가와 같이, 인간-로봇 상호작용 분야의 주요 질문들에 답하는 데 도움이 될 수 있습니다. 이 기술의 함의는 뇌성마비와 같은 운동 장애의 진단으로까지 확장됩니다.
다음 단계는 건강한 사람의 악수와 장애가 있는 사람의 악수를 구분할 수 있는 로봇 진단 장치를 제작하는 것입니다. 텔레로보틱 시스템을 통한 악수 동작은 자연스럽지 않으며, 로봇을 다루고 상호작용하는 방법을 익히는 데 시간과 연습이 필요하므로 이 방법에 대한 시각적 시연이 매우 중요합니다. 고전적인 튜링 테스트의 원래 개념에 따라, 악수 실험은 인간, 컴퓨터, 심문자라는 세 가지 개체로 구성됩니다.
심문자와 피실험자는 같은 방에 앉아 있지만 스크린으로 분리되어 있어, 심문자는 컴퓨터와 인간 중 누가 악수를 생성하고 있는지 알 수 없습니다. 악수는 직접적인 신체 접촉이 아니라, 인간의 악수일 경우에는 두 대의 팬텀 데스크탑 로봇으로, 컴퓨터의 악수일 경우에는 한 대의 팬텀 로봇과 소프트웨어로 구성된 기계적 텔레로봇 인터페이스를 통해 이루어집니다. 컴퓨터 악수의 경우, 컴퓨터 화면에 'handshake'라는 단어가 나타나면 심문자와 피실험자는 즉시 텔레로봇 인터페이스의 스타일러스를 수직 방향으로 움직여 악수 동작을 수행합니다.
심문자의 역할은 두 가지 핸드셰이크를 비교하고, Home 또는 F1 키를 눌러 첫 번째 핸드셰이크를 선택하거나 End 또는 F2 키를 눌러 두 번째 핸드셰이크를 선택함으로써 어느 것이 더 인간과 유사한지 결정하는 것입니다. 이 비디오에서 시연되는 세 가지 실험 프로토콜은 비교 대상이 되는 핸드셰이크의 구성에 따라 서로 다릅니다. 첫 번째 프로토콜은 순수 튜링 테스트 프로토콜로, 인간의 핸드셰이크와 컴퓨터가 생성한 핸드셰이크 사이에서 선택을 진행합니다.
두 번째 프로토콜에는 인간이 생성한 힘과 컴퓨터가 생성한 힘이 다양하게 구성된 악수가 포함됩니다. 세 번째 프로토콜에는 인간이 생성한 악수와 노이즈의 다양한 조합, 또는 순수하게 컴퓨터가 생성한 힘으로 이루어진 악수가 포함됩니다. 실험 중에 '랜덤 파일의 이름을 입력하십시오'라는 프롬프트가 나타나면 랜덤 파일이 자동으로 생성됩니다.
파일이 이미 존재하는 경우, 시스템은 기존 파일을 사용합니다. 그렇지 않은 경우, 시스템은 지정된 이름으로 새로운 무작위 파일을 자동으로 생성합니다. 이 무작위 파일은 서로 다른 핸드셰이크가 발생하는 순서를 정의합니다.
본 실험 프로토콜은 인간과 심문자가 텔레로봇 시스템을 통해 총 24회 악수를 나누는, 2회씩 12번의 연습 시행으로 시작됩니다. 심문자는 이 단계에서 자신이 인간과 악수를 하고 있다는 사실을 알고 있습니다. 이러한 연습 시행의 목적은 참가자들이 텔레로봇 인터페이스에 익숙해지도록 하는 것입니다.
연습 라운드 이후, 각 시행에서 4회 시행으로 구성된 한 블록을 수행합니다. 이 예시에서 보여주는 것과 같이 무작위 순서로 인간의 악수와 네 가지 컴퓨터 모델 악수 중 하나를 비교합니다. 예를 들어, 블록 1의 시행 1에서 심문자는 두 번 악수를 합니다.
첫 번째 악수는 사람이 생성하고, 두 번째 악수는 모델 3에서 규정한 힘을 사용하여 컴퓨터가 생성합니다. 그런 다음 심문자는 악수 1번과 악수 2번 중에서 어떤 악수가 더 사람과 유사한지 선택합니다. 예를 들어, 심문자가 더 사람과 유사하다고 판단하여 악수 1번을 선택했다면, 심문자는 사람의 악수를 선택한 것입니다.
하지만 심문자는 다음 시행에서 인간의 악수를 정확하게 식별했는지 여부를 알지 못합니다. 심문자의 첫 번째 악수는 컴퓨터로 생성된 모델 2와 이루어지고, 두 번째 악수는 인간과 이루어집니다. 심문자는 다시 한번 가장 인간다운 악수를 선택합니다.
유사한 방식으로 두 번의 실험을 더 수행합니다. 나머지 두 모델인 모델 1과 모델 4를 인간의 악수와 비교하여 테스트합니다. 이렇게 하여 한 블록의 실험이 완료됩니다.
본 실험은 11개의 블록으로 구성되며, 각 블록은 4회의 시행으로 이루어지고 4가지 모델 악수가 각 블록 내에서 무작위 순서로 제시됩니다. 첫 번째 블록은 연습 블록이며, 분석은 나머지 10개 블록을 대상으로 수행됩니다. 실험의 10개 블록을 모두 완료하면, 4가지 악수 모델 각각에 대해 인간의 악수와 10회씩 테스트하게 됩니다.
11개의 실험 블록을 모두 완료한 후, 테스트한 4가지 모델 각각에 대해 모델 인간 유사도 등급을 계산합니다. 분석은 피실험자가 모델의 악수가 사람의 악수보다 더 인간답다고 말한 악수의 비율을 계산하여 수행합니다. 예를 들어, 심문자가 10번의 악수 중 2번에서 사람의 악수보다 모델의 악수를 선택했다면, 사람 대비 모델의 비율은 0.2가 되며, 이 비율에 2를 곱하여 모델 인간 유사도 등급을 산출합니다.
비율이 0.2인 각 모델의 경우, 해당 모델의 인간 유사도 등급은 0.4가 됩니다. 만약 10회의 시도 중 4회에서 모델 3이 더 인간과 유사한 것으로 선택되었다면, 해당 모델의 비율은 0.4가 되며 모델 인간 유사도 등급은 0.8이 됩니다. 모델을 인간과 구별할 수 없는 경우, 계산된 비율은 0.5가 되며 모델 인간 유사도 등급은 1이 됩니다.
모델이 그 모델처럼 명백히 비인간적이라면, 인간 유사도 등급은 0이 됩니다. MHLG의 최대치는 1로 제한됩니다. 본 프로토콜에서 생성된 악수는 인간 부분 모델과 분리되며, 특정 조합은 순수 컴퓨터 생성 악수부터 순수 인간 악수까지의 척도에 따라 실험마다 다르게 적용됩니다.
따라서 이 일련의 실험은 가중치 부여 인간 모델 테스트라고 합니다. 프로토콜은 인터로게이터가 순수하게 인간의 악수를 인식하는 법을 익히고 장치에 익숙해지도록 돕는 연습 블록으로 시작됩니다. 이에 따라 연습 블록은 순수한 인간의 악수와 컴퓨터가 생성한 악수를 비교하는 30회의 시행으로 구성됩니다.
각 시도 끝에, 응답자는 두 번의 악수 중 어느 것이 더 인간다웠는지 선택합니다. 응답자가 인간의 악수를 정확하게 식별하면 화면에 정답(correct)이 표시됩니다. 응답자가 정답을 선택하지 못하면 오답(wrong) 메시지가 나타나며, 응답자는 마지막 연습 시도를 반복할 기회를 갖게 됩니다.
연습 블록 이후, 질문자는 두 가지 악수를 평가하기 위해 일련의 시행을 시작합니다. 두 가지 악수는 자극 악수와 기준 악수이며, 각각은 인간의 힘과 모델의 힘이 결합된 형태입니다. 기준 악수에서 질문자가 느끼는 악수는 인간이 생성한 힘과 컴퓨터로 생성된 모델의 힘이 균등하게 혼합된 상태입니다.
다시 말해, 피실험자가 악수 동작을 수행하는 동안, 해당 악수는 심문자가 인지하는 힘의 50%만을 구성하며, 나머지 50%의 힘은 자극 악수의 모델에서 제공됩니다. 따라서 심문자가 느끼는 악수는 인간과 컴퓨터 생성 모델에 의해 생성된 힘이 가변적으로 혼합된 형태입니다. 일부 자극 악수에서는 인간이 기여하는 비율이 절반 이상이며, 따라서 기준 악수보다 더 큽니다. 다른 자극 악수에서는 인간이 기여하는 비율이 절반 미만이며, 따라서 기준 악수보다 더 작습니다.
각 시행이 끝날 때, 피험자는 더 사람처럼 느껴진 악수를 선택하도록 요청받습니다. 본 실험은 두 개의 테스트 모델과 한 개의 베이스 모델을 포함한 총 세 개의 모델을 비교합니다. 순수 프로토콜과 마찬가지로, 본 프로토콜은 분석되지 않은 한 개의 블록으로 시작하며, 이후 10개의 실험 블록이 이어집니다.
각 실험 블록은 세 가지 모델 조합 각각에 대해 모델과 인간의 여덟 가지 선형 조합으로 구성된 24회의 시행으로 이루어집니다. 10개의 실험 블록을 완료하면, 질문자의 답변에 로지스틱 심리물리 함수를 적합시킵니다. 동반 논문에 기술된 바와 같이, 결과 곡선은 질문자의 확률을 나타냅니다.
이에 답하기 위해, 자극 핸드셰이크가 참조 핸드셰이크보다 더 인간과 유사한지 판단합니다. alpha 자극에서 alpha 참조를 뺀 값의 함수로서, 주관적 동등점(PSE)은 사이코메트릭 곡선의 0.5 임계값 수준에서 추출되며, 이는 핸드셰이크가 모델과 동일하게 인간과 유사하다고 인지되는 alpha 자극과 alpha 참조 사이의 차이를 나타냅니다. 가중 인간 모델 프로토콜의 인간 유사도 등급은 0.5에서 PSE를 빼서 계산하며, 가장 덜 인간답게 또는 가장 인간답게 인지되는 모델은 각각 0 또는 1의 모델 인간 유사도 등급 값을 생성합니다. 최종 프로토콜에서는 모델 핸드셰이크를 일부는 인간이고 일부는 무작위 노이즈인 핸드셰이크와 비교합니다.
본 프로토콜에서 자극 핸드셰이크(stimulus handshake)는 모델을 기반으로 컴퓨터가 생성한 핸드셰이크입니다. 또 다른 핸드셰이크인 참조 핸드셰이크(reference handshake)는 인간의 핸드셰이크와 화이트 노이즈의 다양한 조합으로 생성된 힘으로, 최대 절대 힘은 2 N이며 2/π의 최대 주파수에서 5차 저역 통과 버터워스 필터(Lowpass Butterworth filter)를 사용하여 필터링되었습니다. 각 시행의 끝에서 심문자는 더 인간처럼 느껴진 핸드셰이크를 선택하도록 요청받습니다.
이 프로토콜은 이전의 가중치 적용 인간 모델 테스트와 유사한 설계를 가지고 있습니다. 연습 라운드와 분석에서 제외되는 블록을 거친 후, 다음과 같이 10개의 실험 블록 시리즈가 실행됩니다. 이전과 동일하게 심리측정 곡선에서 PSE를 추출하며, 이는 노이즈 추가 프로토콜에 대한 모델의 인간 유사도 등급을 정의합니다.
이 그림은 순수 프로토콜의 결과를 보여주며, 인간의 악수와 두 가지 서로 다른 모델 악수를 비교합니다. 두 지점은 KB one 및 KB two라고 명명된 두 가지 점탄성 모델에 대해 계산된 모델 인간 유사도 등급 값을 나타냅니다. 결과는 모델 KB two가 모델 KB one보다 더 인간과 유사하게 인식됨을 보여줍니다.
이 그림은 가중 모델 인간 프로토콜의 결과를 보여주며, 이는 변화하는 비율의 인간 모델 악수와 고정된 50 50 비율의 인간 모델 악수를 비교한 것입니다. 검은색 마커는 테스트 모델의 모델 인간 유사도 등급을 나타내며, 회색 마커는 기본 모델의 등급을 나타냅니다. 오차 막대는 심리 측정 곡선의 신뢰 구간을 나타냅니다.
이 그림은 모델 핸드셰이크와 인간 성분 및 노이즈 성분의 비율을 달리한 핸드셰이크를 비교한 노이즈 추가 프로토콜의 결과를 보여줍니다. 검은색 표식은 모델의 인간 유사도 등급을 나타내며, 회색 표식은 노이즈의 등급을 나타냅니다. 오차 막대는 사이코메트릭 곡선의 신뢰 구간을 나타냅니다.
이러한 결과는 세 가지 평가 방법을 모두 사용했을 때, 점탄성 모델 KB two가 점탄성 모델 KB one보다 더 인간과 유사하게 인식됨을 입증합니다. 이 절차를 수행하는 동안, 로봇 장치와 적절하게 상호작용하고 상호작용이 최대한 원활하게 이루어지도록 노력하는 것이 중요합니다. 본 절차 외에도, 전반적 발달 장애가 있는 사람의 악수 인식 테스트와 같은 다른 방법들을 통해 '전반적 발달 장애가 인간의 제스처와 비인간의 제스처를 구별하는 능력에 어떤 영향을 미치는가?'와 같은 추가적인 질문에 대한 답을 구할 수 있습니다. 이제 개발된 이 기술은 악수를 인식 도구로 활용하는 길을 열어줄 수 있을 것입니다.
우리는 악수의 목적이 상대방에 대한 정보를 습득하는 것이라는 가설을 세웠습니다. 따라서 인간과 유사한 악수를 구현하기 위해 제안하는 방법론은 상대방의 악수로부터 정보를 추출할 수 있는 악수 분류 시스템의 개발 또한 촉진할 수 있습니다. 이 영상을 시청하고 나면, 1차원 투어 형태의 악수 테스트를 수행하는 방법과 제1회 국제 투어 형태 악수 테스트 토너먼트에 제출된 악수 모델들을 어떻게 평가할 것인지에 대해 충분히 이해하게 될 것입니다.
본 연구는 텔레로보틱 시스템을 이용한 튜링 테스트 방식의 악수 테스트를 통해 인공 악수 모델과 인간 악수의 유사성을 평가하는 방법을 제시합니다. 이 방법은 피험자가 서로 다른 악수를 비교하여 인간과 얼마나 유사한지 평가하는 강제 선택 패러다임을 포함합니다.
계산 모델의 운동 지능을 평가하는 것은 인간-로봇 상호작용의 중대한 공백을 메우는 일이며, 특히 재활 로보틱스 및 보조 기기와 같이 자연스러운 운동 행동이 요구되는 응용 분야에서 더욱 그러합니다. 튜링 방식의 핸드셰이크 테스트는 인간의 운동 패턴에 대한 모델의 충실도를 평가하는 정량적 프레임워크를 제공하여, 전임상 모델 개발 단계에서 기전적 리스크 감소를 지원합니다. 이를 통해 신경운동 경로의 표적 검증에 대한 예측 신뢰도를 높일 수 있으며, 운동 기능 회복에 초점을 맞춘 초기 발견 단계에서 진행 여부(go/no-go) 결정을 내리는 데 유용한 정보를 제공합니다.
이 방법은 운동 제어 경로의 가설 검증에 정보를 제공하고, 표준화된 운동 출력을 통해 분석 준비 상태를 가능하게 하며, 인간 벤치마크 대비 모델 성능의 분석 중심 비교를 지원함으로써 발견의 연속체(discovery continuum)에 통합됩니다.