チューリングテストとは?会話で人間とAIを見分ける考え方と、その限界

顔も声も見えない相手と、文字だけで会話をする。その相手が人間なのかコンピューターなのか、見分けられるでしょうか。チューリングテストは、機械の知性を考えるために、こうした会話の場面へ注目したアイデアです。

チューリングテストとは

チューリングテストとは、文字によるやり取りなどを通じて、機械の応答を人間の応答から区別できるか、という観点で機械の振る舞いを考えるテストです。数学者アラン・チューリングが1950年の論文『Computing Machinery and Intelligence』で提案した「模倣ゲーム」が出発点です。

チューリングは「機械は考えることができるか」という問いを、言葉の定義だけで議論する代わりに、具体的なゲームへ置き換えようとしました。1950年の論文全文では、その提案を読むことができます。

模倣ゲームは、どんな仕組み?

原論文の導入は、男性・女性・質問者の3人が参加し、質問者が相手を見ずに区別しようとするゲームです。そのうちの一人を機械へ置き換えたらどうなるか、と問いを進めます。一般にチューリングテストとして紹介される形は、人間と機械の応答を、判定者が文字だけで見分けようとするものです。

参加者役割のイメージ
判定者相手の姿や声を手掛かりにせず、質問や対話から判断する
人間の応答者質問に答える
機械の応答者人間らしい応答を返そうとする

見た目の精巧さや、速く走れることを競うテストではありません。会話という窓から、知的な振る舞いを捉えようとします。

「合格した」は、条件と一緒に読む

会話が1分なのか30分なのか、雑談なのか専門的な質問なのか、判定者が何人いるのか。こうした条件によって、見分けやすさは変わります。「人間と区別できなかった」という結果を聞いたら、誰が、どんな条件で、どれくらい区別できなかったのかまで見ると、結果の意味がつかめます。

原論文に登場する「5分」「正しく見分ける確率70%」という数字は、チューリングが将来の機械について述べた予測の一部です。それだけが、あらゆる実験に共通する絶対的な合格規則というわけではありません。

会話が自然なら、すべて正確なの?

自然な返答と、事実の正確さは別の評価軸です。たとえば架空のカフェについて、「落ち着いたお店ですよ」と滑らかに返答できても、その店が実在し、営業時間が正しいとは限りません。予定の相談が上手でも、カレンダーへ正しい日時で登録できるかは、実際の操作で確かめる必要があります。

ゲームを作る場面でも、キャラクターの自然な会話と、ルールの正しい判定は別々に試せます。楽しい受け答えをしてくれることと、勝敗や所持アイテムを間違えないことは、どちらも遊びの体験に関わります。評価する目的に合わせて、質問や確認方法を選ぶことが大切です。

意識や理解があることまで、わかる?

外から見える応答を調べても、それだけで「内側に意識がある」「人間と同じ仕方で理解している」と決着するわけではありません。逆に、人間らしく話さない機械にも、特定の問題を解く高い能力はありえます。

振る舞いと理解の関係は、中国語の部屋という思考実験でも論じられます。計算する仕組みの話へ進みたい人にはチューリングマシンの記事もおすすめです。チューリングテストの面白さは、万能な知性の証明を出すことより、「何を見れば知的だと感じるのか」を自分にも問い返してくるところにあります。

コメントを残す

メールアドレスが公開されることはありません。 * が付いている欄は必須項目です