2026年 査読付き学術誌 AIによる深掘り 回答品質・妥当性 調査モード比較
AIの追加質問は自由記述をどこまで豊かにするか 1,800人規模のランダム化web調査で、会話AIが自由記述に追質問し、その場でコード化・確認する方法を検証。回答はより詳細で情報量が増え、調査専用の追加学習なしでも回答の分類は中程度に機能したが、同意傾向に由来する偽陽性と、わずかな回答者体験の悪化が残った。量と質の改善を「完全な人間代替」と読まないための有用な根拠。
AI-Assisted Conversational Interviewing: Effects on Data Quality and Respondent Experience
Soubhik Barari, Jarret Angbazo, Natalie Wang, Leah M. Christian, Elizabeth Dean, Zoe Slowinski, Brandon Sepulvado · Survey Research Methods, 20(2), 161–180
研究方法・結果・限界を見る 研究方法 AIとの対話を明示して同意を得た後、3条件に無作為割当。2024-07-15〜17に実施し、確認プローブ/精緻化プローブ等を比較。回答者確認と独立人間コーダーを用いてコード化を評価。 対象・規模 合計1,998インタビュー(完了1,803、途中離脱195)。各条件で完了約601件。パネル参加者、スマートフォン65%、デスクトップ32%。 報告された結果 AIのライブコーディングは調査固有のfine-tuningなしでも中程度に有効。自由記述はより詳細・情報的になった一方、体験には小さなコストがあり、確認プローブでは同意傾向に起因する偽陽性が増えた。 読み取りの限界 設問順が離脱に影響し得る、設問別の完了時間は測れない、回答時間は回答努力とAI遅延を分離できない、終了時の自己評価は離脱者を含まず上方バイアスの可能性。 確認した範囲 原典の全文を確認 発表情報 査読付き誌掲載(誌面のPublished: 2026-08-10) DOI:10.18148/srm/2026.v20i2.8624
最終確認:2026-09-13
原典を読む ↗ 2026年 査読付き学術誌 音声・アバター AIによる深掘り 回答品質・妥当性 調査モード比較
顔と声を持つAI聞き手は、チャットより回答を豊かにするか LLM、音声認識、生成アバターを組み合わせたVirtual Agent Interviewerを、テキストAIチャットボットと比較した無作為化実験。顔と音声を備えた条件は、チャットボット条件より情報量・具体性と参加の強さが高く、所要時間あたりの関与も高かった。一方で満足度の有意差は示されず、会話の遅延と不気味さへの反応が残った。
Talking surveys: How photorealistic embodied conversational agents shape response quality, engagement, and satisfaction
Matus Krajcovic, Peter Demcak, Eduard Kuric · Behavior Research Methods, 58, Article 212
研究方法・結果・限界を見る 研究方法 英国のオンライン・パネル参加者を、顔・音声付き/テキスト型のAIエージェントと、BFI-2-S/CFQの2質問票の4群(各20人)へ自動割当。いずれも追質問を含む調査を実施し、自由記述の品質、関与、満足度、任意の自由記述フィードバックを比較した。 対象・規模 80人(英国の一般インターネット利用者を層化抽出)。4条件各20人。追質問会話の回答は2,265件(欠損15件控除後)。 報告された結果 著者は、顔・音声付き条件で情報量・具体性と、より時間効率のよい関与が有意に高いと報告した。満足度は有意に変わらず、遅延、考える時間、筆記への好み、不気味の谷反応が自由記述に現れた。 読み取りの限界 比較は顔・音声・アバターを一体として操作しており、各要素の効果を分離できない。2つの心理測定質問票と選択した追質問に限られ、報酬付きオンライン・パネルの0%離脱は一般運用への外挿を制限する。 確認した範囲 出版社のオープンアクセス全文を確認 発表情報 査読付き誌のOriginal Manuscript。2026-06-29公開。arXiv v2(2026-06-30)は同題の著者版であり、ここでは誌掲載版を採用。 DOI:10.3758/s13428-026-03091-0
最終確認:2026-09-13
原典を読む ↗ 2026年 査読付き会議論文 AIによる深掘り 回答品質・妥当性 自己開示・バイアス 音声・アバター
既製の音声LLMは、深掘りより相づちに偏る 既製のリアルタイム音声MLLMを使う半構造化InterviewBotを15人へ実運用し、会話行動と体験を分析。相づちは多い一方で深掘り質問は少なく、複数質問の束ね方が情報欠落を生んだ。人の評価圧がないことで開示しやすい参加者がいる一方、詳しく答える努力が下がるという両面を示した。
When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews
He Zhang, Kambinachi Chukwuma, ChanMin Kim, John M. Carroll · ACM Conference on Human Computation and Crowdsourcing (HCOMP 2026), accepted; arXiv:2608.10412v1
研究方法・結果・限界を見る 研究方法 遠隔Zoomセッションで、研究者作成アウトラインに基づくAI主導の音声面接(約15〜30分)の後、別目的・別順序の人間研究者による振り返り面接(約20分)を実施。AI面接15件のbot発話428ターンをコード化し、振り返り15件を迅速テーマ分析した。 対象・規模 参加者15人(平均21.53歳、米国の研究大学の学生中心)。AI面接は15件、分析したbotターンは428件。後続の人間面接は同一テーマ・同一条件の対照ではない。 報告された結果 深掘りプローブは全botターンの4.9%(質問を含むターンの9.1%)、複数質問を含むターンは質問を含むターンの28.7%だった。参加者5人はAI相手の方が快適/開示しやすいと述べたが、対人の期待がないため回答を浅くしたという語りもあった。 読み取りの限界 単一大学の若く技術に慣れた小標本で、事前のAI経験・態度を測定していない。人間による振り返りはテーマ、目的、時間、順序が異なるため、面接者種別の因果比較ではない。文字起こしの話者誤帰属に手動の分離処理を要した。 確認した範囲 arXiv v1のHTML全文を確認 発表情報 arXiv v1は2026-08-11。原典コメントでACM HCOMP 2026採択済みを確認。会議最終版のページネーションは未確認。 DOI:10.1145/3834580.3838754
最終確認:2026-09-13
原典を読む ↗ 2026年 査読付き学術誌 AIによる深掘り 回答品質・妥当性 国内の研究
19問の対話型アンケートは、暗黙知を言語化できるか 筑波大学の研究。GPT-4.1-nanoを使う対話型アンケートで、芸術・デザイン系学生13人に余白の認識を質問した。考えの言語化には肯定的な評価が多い一方、自然さと考えを深める働きには課題が残った。
生成AIを活用した対話型アンケート調査の探索的検証―芸術系学生を対象とした実装と評価―
大杖 裕喜, 山田 博之 · 日本感性工学会論文誌, 25(2), 93–102
研究方法・結果・限界を見る 研究方法 視覚デザインの余白を題材に、文脈に応じて質問する19問のチャット型アンケートを実施し、体験を探索的に評価。 対象・規模 芸術・デザイン系学生13人。視覚デザインにおける余白の認識について、全員がAI対話型アンケートに回答した。 報告された結果 言語化できたとの評価は77%。対話の自然さを肯定したのは38%、思考の深まりを肯定したのは46%だった。 読み取りの限界 芸術・デザイン系学生13人、余白という一題材の探索的研究。確認範囲は抄録で、対照条件や回答品質の外部評価の詳細は未確認。他の対象者への一般化には限界がある。 確認した範囲 J-STAGEの原典書誌・抄録を確認(本文PDFは未確認) 発表情報 日本感性工学会論文誌の原著論文。2026-03-02受理、2026-04-30 J-STAGE公開。 DOI:10.5057/jjske.TJSKE-D-25-00078
最終確認:2026-09-14
原典を読む ↗ 2026年 プレプリント AIによる深掘り 自己開示・バイアス 回答品質・妥当性 音声・アバター
1,052人へのAI面接記録で、本人の回答を予測する 米国成人1,052人への約2時間のAI音声面接から、個人を模すLLMエージェントを作成。面接記録は下流の回答予測に役立ったが、予測精度を面接の品質や人間の聞き手との同等性と読み替えることはできない。
LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals
Joon Sung Park, Carolyn Q. Zou, Jonne Kamphorst, Niles Egan, Aaron Shaw, Benjamin Mako Hill, Carrie Cai, Meredith Ringel Morris, Percy Liang, Robb Willer, Michael S. Bernstein · arXiv:2411.10109v3 [cs.AI, cs.HC, cs.LG]
研究方法・結果・限界を見る 研究方法 生活史・価値観等の半構造化AI面接と構造化調査を収集し、面接のみ・調査のみ・併用の個人エージェントを比較。約2週間後の本人の再回答を基準に評価。 対象・規模 米国成人1,052人。AIによる英語音声面接は約2時間。 報告された結果 保持したGSS設問で、本人の再回答の一致度を基準とする正規化精度は、面接のみ83%、調査のみ82%、併用86%、属性のみ74%。通常の正答率とは異なる。 読み取りの限界 評価対象は個人の模擬エージェントによる予測。熟練人間面接者との因果比較ではなく、英語・米国成人・特定実装に限る。個人記録からの推論に関するプライバシーの課題もある。 確認した範囲 arXiv v3の原典PDF(本文・補足資料のAI面接者、標本、評価、プライバシー記述)を確認 発表情報 arXiv v1は2024-11-15に『Generative Agent Simulations of 1,000 People』として公開。現行v3は2026-06-28改訂され、著者2名追加・現題へ変更。査読付き刊行版は今回確認できない。 DOI:10.48550/arXiv.2411.10109
最終確認:2026-09-14
原典を読む ↗ 2026年 プレプリント AIによる深掘り 自己開示・バイアス 回答品質・妥当性
面接後のAI編集は、深い回答を保って個人情報を減らせるか AI利用経験を聞くチャット面接の後に、参加者自身が記録を修正する実験。個人識別情報をAIが示して編集を助けると、記録中の個人識別情報を減らせた。回答品質や関与に有意な低下は見られなかった。
Disclose with Care: Designing Privacy Controls in Interview Chatbots
Ziwen Li, Ziang Xiao, Tianshi Li · arXiv:2602.01387 [cs.HC]
研究方法・結果・限界を見る 研究方法 米国の成人188人をAI支援編集60人・自由編集62人・編集なし66人へ無作為割当。面接前後の記録に含まれる個人識別情報、回答品質、体験を比較。 対象・規模 AIを就職面接やその準備に使った経験を持つProlific参加者188人。所要時間の中央値19分。 報告された結果 AI支援編集群の記録全体で個人識別情報が41.2%減少。自由編集群は2.6%増加した。回答品質と関与に有意差がないことは、同等性や完全な匿名化の証明ではない。 読み取りの限界 米国のAI利用経験者と一つの題材に限る。個人識別情報の検出や品質評価には自動判定を含み、情報の完全除去を保証する研究ではない。 確認した範囲 arXiv v1の原典PDF(システム、方法、結果、制約記述)を確認 発表情報 arXiv v1は2026-02-01。査読付き刊行版は今回確認できない。 DOI:10.48550/arXiv.2602.01387
最終確認:2026-09-14
原典を読む ↗ 2026年 プレプリント AIによる深掘り 回答品質・妥当性 自己開示・バイアス
対話の先読みで、予定外の論点まで掘れるか 予定した話題の網羅と、会話から生まれる新論点の追究を両立させるAI面接者。7職種70人の実対話では、既存AI面接者MimiTalkより内容の網羅性・深さ・正確さを高く評価された。
SparkMe: Adaptive Semi-Structured Interviewing for Qualitative Insight Discovery
David Anugraha, Vishakh Padmakumar, Diyi Yang · arXiv:2602.21136 [cs.HC]
研究方法・結果・限界を見る 研究方法 同じ職場のAI利用ガイドで、SparkMeとMimiTalkに各35人を割当。最大45分の面接、参加者評価、同職種による新規論点評価を実施。別にAI回答者の模擬実験も行った。 対象・規模 Upworkの7職種各10人、分析70人。各条件35人。別に任意離脱3人。 報告された結果 5段階の参加者評価で、網羅性4.37対3.14、深さ4.06対3.09、正確さ4.23対3.46。これらは参加者の評定値であり、事実の正答率ではない。 読み取りの限界 人間面接者とは比較していない。人間の実対話と、AI回答者による制御実験を分けて読む必要がある。特定職種とAI利用という題材に限られる。 確認した範囲 arXiv v1の原典PDF(設計、実対話ユーザースタディ、結果、限界、付録の募集詳細)を確認 発表情報 arXiv v1は2026-02-24。査読付き刊行版は今回確認できない。 DOI:10.48550/arXiv.2602.21136
最終確認:2026-09-14
原典を読む ↗ 2026年 査読付き学術誌 継続調査・現場導入 AIによる深掘り 自己開示・バイアス 回答品質・妥当性
WhatsAppで繰り返すAI面接は、短い回答から何を引き出せるか 12週間の体重管理プログラム内で、WhatsAppのAIが繰り返し聞き取り。短い回答でも継続して新論点を得られた一方、支援的な口調や内省を促す質問が、回答や行動を変える可能性が示された。
Conversational, Longitudinal, Ecological Assessment (CLEA): Exploring a new AI-driven method for qualitative data collection in a behavioural health context
Samuel Downes, Thomas Krys, Kenton O’Hara, Max Western, Lauren Thompson, Amberly Brigden · PLOS Digital Health, 5(5), e0001216
研究方法・結果・限界を見る 研究方法 英国のプログラム参加者に原則週2回、GPT-4 Turboによる質問を配信。実際の収集はプログラム第3〜12週に設定した18回の枠で行い、ログ分析と終了後の人間による振り返り面接を実施。 対象・規模 9人(平均46歳)。参加開始は第3〜5週で異なる。AI555メッセージ、回答者572メッセージ。全員へ終了後面接を実施。 報告された結果 予定セッションの80%で回答を収集(完了102件、部分完了13件)。回答を12時間以上遅らせた機会は33%。個々の返信は短いが、継続して新たな関連コードを得た。 読み取りの限界 単一プログラムの9人で、他方式との直接比較はない。回答遅延は出来事の直後を捉える力を弱め、支援的な会話は中立な測定にとどまらない可能性がある。 確認した範囲 PLOSの原典HTML全文(書誌、方法、結果、議論、限界)を確認 発表情報 査読付きResearch Article。Received 2026-01-20、Accepted 2026-04-28、Published 2026-05-27。 DOI:10.1371/journal.pdig.0001216
最終確認:2026-09-14
原典を読む ↗ 2025年 査読付き会議論文 AIによる深掘り 調査モード比較 回答品質・妥当性
AIの深掘りは人間面接と同じ水準に届くか 大学生を同一質問票のAI面接と人間面接に割り当てた小規模な実地比較。GPT-4を用いたAI面接は、人間面接と比べて回答の明確さ・具体性・関連性に大きな低下を示さず、実装次第で会話型調査として成立し得ることを示した。一方、遅延、音声入力・文字起こしの不具合、学生サンプルと観察者の存在が結論を強く限定する。
AI Conversational Interviewing: Transforming Surveys with LLMs as Adaptive Interviewers
Alexander Wuttke, Matthias Aßenmacher, Christopher Klamm, Max M. Lang, Quirin Würschinger, Frauke Kreuter · Proceedings of LaTeCH-CLfL 2025 (ACL Anthology)
研究方法・結果・限界を見る 研究方法 Zoom上の授業内パイロット。参加学生はAI実施と人間実施の両方を経験し、順序と役割を割当。政治トピックの同一質問票、事後評価、独立コーダーによる回答品質評価を実施。AIはGPT-4 Turbo(04/2024)とChainlitの音声補助UI。 対象・規模 大学で調査方法論を学ぶ学生による小規模サンプル。本文はsmall-Nと明記するが、確認した本文箇所では解析人数の明確な総数を確認できなかった。 報告された結果 人間・AIの回答は、明確さ、共感性、関与、複雑さ、文法、具体性、口調、関連性で概ね類似と評価された。AIでは応答待ち時間と録音/転写の不具合が体験を損ねた。 読み取りの限界 小標本、調査方法論に関心のある学生に偏ること、AI面接を学生が観察したため匿名性による開示効果を検証できないこと、当時の閉鎖モデルへの依存。 確認した範囲 原典の全文を確認 発表情報 査読付き会議論文(ACL Anthology掲載。arXiv初版は2024年) DOI:10.18653/v1/2025.latechclfl-1.17
最終確認:2026-09-13
原典を読む ↗ 2025年 査読付き学術誌 音声・アバター 回答品質・妥当性 架空シナリオでの検証
架空の回答を使い、AI電話調査の記録精度を検証 LLM電話エージェントが33問のCOVID Impact Surveyを実施し、別のGPT-4oが会話から構造化回答を抽出するパイロット。8人がLLM生成の架空ペルソナを演じて40回回答し、抽出精度98%、単語誤り率7.7%を報告した。ただし、実在の生活経験を答えたデータではないため、AI面接が本音や洞察を得られる根拠としては使えない。
Automated survey collection with LLM-based conversational agents
Kurmanbek Kaiyrbekov, Nicholas J. Dobbins, Sean D. Mooney · JAMIA Open, 8(5), ooaf103
研究方法・結果・限界を見る 研究方法 BlandAIの会話型電話エージェントで調査・文字起こしを行い、GPT-4oが回答を推定。8人が5つずつのLLM生成架空ペルソナを演じ、計40調査を実施。 対象・規模 8人(NIH職員3人、研究グループ5人;女性3人、男性5人、英語母語話者5人・非母語話者3人)。各人が架空ペルソナとして5回回答。 報告された結果 会話からのGPT-4oの回答抽出精度は平均98%、文字起こしの平均WERは7.7%。参加者は時折のエラーを指摘しつつ、理解・会話維持を概ね肯定的に評価した。 読み取りの限界 便宜標本8人で小規模。参加者は実体験でなくLLM生成ペルソナを演じたため、実世界の回答妥当性・自己開示・誘導の検証ではない。 確認した範囲 原典の全文を確認 発表情報 査読付き誌掲載(Published 2025-10-30); 擬似ペルソナ回答を用いるため主たる人間回答の有効性根拠には分類しない DOI:10.1093/jamiaopen/ooaf103
最終確認:2026-09-13
原典を読む ↗ 2025年 プレプリント AIによる深掘り 回答品質・妥当性 自己開示・バイアス
AI聞き手は質問ガイドを守れるが、飛ばし・誘導も起こす 代替タンパク質への意見を題材に、会話AI聞き手の半構造化面接を16人で検証したプレプリント。AIは質問ガイドに沿い、共感的に応答し、詳述を促せた一方、話題の飛ばし、無応答、冗長さ、回答からの仮定による誘導が確認された。
The AI Interviewer: Exploring the Use of Conversational AI-Enabled Chatbots in Qualitative Data Collection
Liang Ze Wong, Siti Amelia Juraimi, Yin Zhien Tan, Siyuan Brandon Loh, Mary F-F. Chong, Prasanta Bhattacharya, Aimee E. Pink · SSRN working paper, 5194078
研究方法・結果・限界を見る 研究方法 参加者はAI聞き手との面接とオンライン調査を無作為化した順序で経験し、その後に体験についての半構造化面接を受けた。著者はAI面接の記録を分析し、AIの遂行と参加者体験を検討した。 対象・規模 16人(男性9人、平均35.1歳、SD=10.7)。AI面接、オンライン調査、事後の人間による半構造化フィードバック面接を各参加者が経験した。 報告された結果 参加者の56.25%は将来もこの収集法を使いたいと回答し、18.75%はAIが自分を理解しない、または全問を入力するため時間がかかると感じた。AIには話題の飛ばし、無応答、冗長な応答、仮定に基づく誘導という好ましくない挙動があった。 読み取りの限界 SSRNの書誌・要旨で確認したプレプリントであり、原稿本文の条件別比較、コーディング手順、効果量は未確認。16人の小標本で、代替タンパク質という単一題材に限られる。 確認した範囲 検索で取得したSSRNの書誌・抄録を確認(本文未確認) 発表情報 SSRN掲載日は2025-04-24、原稿日付は2025-03-26。今回の確認では査読付き掲載版を確認できない。 DOI:10.2139/ssrn.5194078
最終確認:2026-09-13
原典を読む ↗ 2025年 査読付き会議論文 音声・アバター AIによる深掘り 回答品質・妥当性 国内の研究
国際会議でERICAが実際に聞き手を務めた 京都大学のERICA/TELECOを用い、SIGDIAL 2024会場で参加者へ実際にインタビューした事例研究。傾聴、会話修復、流暢さへの適応と、面談後のLLMによる分析・発表までを統合した。42人中29人(69%)が体験を肯定的に記述した一方、固定質問の反復性や人間らしい外見への不快感も報告された。
Human-Like Embodied AI Interviewer: Employing Android ERICA in Real International Conference
Zi Haur Pang, Yahui Fu, Divesh Lala, Mikey Elmers, Koji Inoue, Tatsuya Kawahara · Proceedings of the 31st International Conference on Computational Linguistics: System Demonstrations, 136–150
研究方法・結果・限界を見る 研究方法 国際会議SIGDIAL 2024の2日間で、ERICAまたはTELECOが音声インタビューを実施。参加者のAIとの過去経験、人間らしいAIへの見解、対話体験を収集し、会話後処理で分析・発表を自動化したケーススタディ。 対象・規模 42人。34人はAIとの対話経験あり、8人は経験なし。 報告された結果 42人中29人が対話を楽しく関与を促すものと記述した。応答時間、明瞭さ、正確さ、人間らしいコミュニケーションが重要とされた。固定テンプレートの質問は反復的との批判があり、ERICAの外見には不快と共在感の双方の反応があった。 読み取りの限界 国際会議における2日間・42人の予備的事例で一般化できない。質問は分析の安定性のためテンプレート固定で、動的な追質問を評価していない。音声入力のみで、表情・身体動作などの情報を解釈していない。 確認した範囲 ACL Anthology原典PDFの全文を確認 発表情報 COLING 2025 System Demonstrationsの会議論文。ACL Anthologyに掲載。DOIは掲載ページで示されていない。 最終確認:2026-09-13
原典を読む ↗ 2025年 査読付き学術誌 AIによる深掘り 回答品質・妥当性
AI面接は、回答の具体的な動機まで引き出せるか 399人で、LLMベース2種と固定質問のベースラインを含む3種類のチャットボットを比較した事例研究。既存のチャットボット品質指標では高評価の回答を引き出せても、参加者固有の動機や個別例をほとんど捉えられず、社会的文脈の複雑性・具体性を測る「richness」では低調だった。さらに、品質・richness評価でLLMと人間の評定者間一致は低く、AI面接の拡大と自動評価の双方へ警鐘を鳴らす。
Collecting Qualitative Data at Scale with Large Language Models: A Case Study
Alejandro Cuevas, Jennifer V. Scurrell, Eva M. Brown, Jason Entenmann, Madeleine I. G. Daepp · Proceedings of the ACM on Human-Computer Interaction, 9(2), 1–27
研究方法・結果・限界を見る 研究方法 大規模ユーザースタディ(n=399)。2つのLLMベース面接チャットボットと、ハードコードした質問によるベースラインの計3条件を比較し、関与・参加者体験・有効な対話の既存指標・richness尺度で評価。 対象・規模 399人。確認した出版社登録抄録では、募集母集団、条件別人数、無作為化の詳細は特定できない。 報告された結果 既存の評価指標では高品質とみなされる回答を得た一方、具体的動機・個別例が乏しくrichnessは低かった。品質とrichnessの双方でLLM評価と人間評価の評定者間一致は低かった。 読み取りの限界 査読付き掲載版の書誌・抄録を確認したが、本文の詳細な効果量・条件別結果・参加者特性は追加確認が必要。特定システムと研究条件の結果をAI面接一般へ拡張できない。 確認した範囲 ACMがCrossrefへ登録した刊行版の書誌・抄録と、arXiv v3の書誌・要旨を照合(刊行版本文は未確認) 発表情報 2025-05-02にACM誌掲載。旧arXiv v3(2024-12-03)のプレプリント分類を更新。同一研究としてIDは維持し重複計上しない。 DOI:10.1145/3710947
最終確認:2026-09-14
原典を読む ↗ 2025年 プレプリント 音声・アバター AIによる深掘り 回答品質・妥当性 調査モード比較
AI電話調査で残る、自由回答の深掘りの課題 米国パイロットとペルーでAI電話調査を運用。構造化設問や分岐・基本的な確認は処理できた一方、自由回答の深掘りは人間より限定的だと著者は報告した。
Telephone Surveys Meet Conversational AI: Evaluating a LLM-Based Telephone Survey System at Scale
Max M. Lang, Sol Eskenazi · arXiv:2502.20140v2 [cs.HC, cs.CL]
研究方法・結果・限界を見る 研究方法 Web通話リンクと発信電話で参加を募り、AIが自由記述・選択式を含む調査を実施。完了状況と会話記録を分析した。 対象・規模 米国パイロットは75件のWeb通話試行。ペルー本調査はクライアントが対象化した主に大学生2,739人への接触枠で、Web通話招待200件と発信電話2,539件から成る。完全完了はWeb11件、発信電話131件の計142件(発信電話131件には不在後の折り返し3件を含む)。分析した会話品質は完全完了分に限る。 報告された結果 ペルーの完全完了はWeb通話11件、発信電話131件。完全完了会話の自由回答は平均18.58語で、著者は深掘りの弱さを指摘した。構造化回答の人間との近さは定性的な評価である。 読み取りの限界 接触した人数を回答完了人数と混同しない。国・募集方法・言語が異なり、人間の聞き手との無作為比較ではない。質問票は専有情報で再現性に制約がある。 確認した範囲 arXiv v2の原典HTML(本文のシステム、募集、接触枠・完了数、結果、議論)を確認 発表情報 arXiv v1は2025-02-27、現行v2は2025-03-12改訂。arXivの原典コメントで『Accepted at 80th AAPOR Conference 2025』を確認。査読付き論文集の刊行版は今回確認できない。 DOI:10.48550/arXiv.2502.20140
最終確認:2026-09-14
原典を読む ↗ 2025年 査読付き学術誌 音声・アバター 自己開示・バイアス 回答品質・妥当性 調査モード比較
人間らしい聞き手は、開示と評価圧を同時に強める 仮想人間・テキストボット・質問票を160人で比較。仮想人間は一部の体験を長く語らせた一方、敏感な質問では回答拒否や社会的に望ましい回答が増えた。
Effects of a computer's human likeness on disclosure in psychosocial assessments: A randomised trial
Tingting Zhu, Elizabeth Broadbent · Computers in Human Behavior, 169, Article 108683
研究方法・結果・限界を見る 研究方法 18の選択式・6つの自由記述からなる心理社会的評価に、3種類の聞き取り方式を無作為割当。語数、回答拒否、社会的望ましさ、体験を比較。 対象・規模 160人(平均24歳、女性117人、男性42人、ノンバイナリー等1人)。3条件への無作為割当。 報告された結果 仮想人間では孤独感を低く答え、回答拒否も多かった。ストレス事象や肯定的感情の記述は長かった。非センシティブ項目の偏り・回答拒否には群差がなかった。 読み取りの限界 出版社抄録・書誌のみの確認で、実装、効果量、条件別人数は未確認。若い参加者中心の単一研究で、長い回答を正確さや深さと同一視できない。 確認した範囲 出版社の原典オープンアクセス書誌・抄録およびハイライトを確認(全文の取得は確認時に不可) 発表情報 査読付きResearch article。Computers in Human Behavior 169、2025年8月、Article 108683。 DOI:10.1016/j.chb.2025.108683
最終確認:2026-09-14
原典を読む ↗ 2024年 査読付き学術誌 調査モード比較 回答品質・妥当性
チャットボット調査は、通常のweb調査に勝てるか オランダの304人をSkype上の事前プログラムbotかQualtrics web調査に割り当て、ニュース接触を14日間追跡。botがweb調査を上回る証拠は見つからず、web側の方が短時間で自由記述も長く、信頼性・体験評価も良好だった。チャット形式というだけで回答品質が上がるという主張への重要な反証であり、継続参加の設計も検証対象にする必要がある。
Comparing Chatbots and Online Surveys for (Longitudinal) Data Collection: An Investigation of Response Characteristics, Data Quality, and User Evaluation
Brahim Zarouali, Theo Araujo, Jakob Ohme, Claes de Vreese · Communication Methods and Measures, 18(1), 72–91
研究方法・結果・限界を見る 研究方法 事前登録済みの縦断比較。パネルの成人をchatbot(Skype)またはweb survey(Qualtrics)に無作為割当し、14日連続のニュース消費回答、回答率・時間・自由記述長・注意チェック・信頼性・体験を評価。 対象・規模 オランダのパネル参加者304人(chatbot 148、web 156)。18歳以上、スマートフォン所有、Skypeアカウントが参加要件。 報告された結果 初日の回答率差は有意でない一方、chatbotは回答時間が長く、自由記述は短かった。心理的リアクタンス尺度の内的一貫性はwebが高く、楽しさ・有用性・安全性の評価もchatbotが低かった。14日目はchatbotの低下が大きかった。 読み取りの限界 このbotはあらかじめ定めた会話フローで、動的LLM追質問ではない。縦断分析で利用端末を日ごとに統制しておらず、Skype利用可能なパネルに限定される。 確認した範囲 原典の全文を確認 発表情報 査読付き誌掲載(最終版リポジトリPDF、誌面2024年) DOI:10.1080/19312458.2022.2156489
最終確認:2026-09-13
原典を読む ↗ 2024年 査読付き学術誌 AIによる深掘り 回答品質・妥当性
追質問の型によって、得られる情報と離脱が変わる 半構造化面接の聞き手として、概念への追質問、関連概念への追質問、一般的追質問の3方式を扱った研究。アルゴリズム生成と人間Wizard作成の追質問を含む26人のユーザースタディで、概念・関連概念型は低い離脱と高い関連性、一般型はより情報的な回答に結び付いたと報告した。
Designing the Conversational Agent: Asking Follow-up Questions for Information Elicitation
Jiaxiong Hu, Jingya Guo, Ningjing Tang, Xiaojuan Ma, Yuan Yao, Changyuan Yang, Yingqing Xu · Proceedings of the ACM on Human-Computer Interaction, 8(1), Article 43
研究方法・結果・限界を見る 研究方法 会話エージェントが追質問を行うユーザースタディ(N=26)。3種類のアルゴリズム的追質問と人間Wizardが作る追質問を用い、読みやすさ、情報引き出し、離脱、関連性を評価し、対話データを質的分析した。 対象・規模 ユーザースタディ参加者26人。確認した原典要旨・書誌ページでは、条件ごとの人数と面接回数は特定できなかった。 報告された結果 追質問は読みやすく情報引き出しに有効と報告された。概念型と関連概念型は離脱率が低く関連性が高く、一般的追質問はより情報的な回答を引き出した。質的分析ではアルゴリズムの弱点とWizardの追質問技法を抽出した。 読み取りの限界 確認範囲は大学リポジトリの書誌・抄録で、詳細な課題、割当、効果量、参加者属性は本文で未確認。LLMのリアルタイム自律面接ではなく、アルゴリズム追質問と人間Wizardの比較を含む研究である。 確認した範囲 大学リポジトリの原典書誌・抄録を確認(本文未確認) 発表情報 査読付き学術誌論文として2024-04-23掲載。 DOI:10.1145/3637320
最終確認:2026-09-13
原典を読む ↗ 2024年 査読付き会議論文 音声・アバター 自己開示・バイアス 調査モード比較 採用面接の体験
仮想面接官の見た目と、応募者の体験を比べる AI搭載の非同期ビデオ面接で、仮想面接官の性別と肌色を変えた218人の被験者間実験。仮想面接官の人口統計属性は全体の面接体験を有意に変えなかった一方、回答者の人口統計属性はAIビデオ面接の知覚に影響した。社会的存在感と仮想面接官の知覚が、公平性・プライバシー・印象管理の知覚に媒介的に関係した。
“Hi. I’m Molly, Your Virtual Interviewer!” Exploring the Impact of Race and Gender in AI-Powered Virtual Interview Experiences
Shreyan Biswas, Ji-Youn Jung, Abhishek Unnam, Kuldeep Yadav, Shreyansh Gupta, Ujwal Gadiraju · Proceedings of the AAAI Conference on Human Computation and Crowdsourcing, 12(1), 12–22
研究方法・結果・限界を見る 研究方法 AI-powered asynchronous video interview(AVI)の仮想面接官について、性別と肌色を操作した6条件の被験者間研究。公平性、プライバシー、印象管理などの知覚を分析した。 対象・規模 218人、6実験条件。確認した出版社要旨では、実際の面接件数、各条件人数、募集母集団は特定できなかった。 報告された結果 仮想面接官の性別・肌色は全体の面接体験へ有意な影響を示さなかった。回答者自身の人口統計属性はAVI過程の知覚を有意に変え、社会的存在感と面接官知覚は公平性(正)、プライバシー(負)、印象管理(正)の知覚と関係した。 読み取りの限界 出版社の書誌・要旨までの確認であり、本文の操作詳細、測定尺度、効果量、回答品質は未確認。採用選考文脈のAVI体験研究で、定性調査のためのAI聞き手の性能比較ではない。 確認した範囲 AAAI Proceedingsの原典書誌・抄録を確認(本文詳細は未確認) 発表情報 HCOMP 2024の査読付き本論文。採用の非同期ビデオ面接を扱う。 DOI:10.1609/hcomp.v12i1.31596
最終確認:2026-09-13
原典を読む ↗ 2024年 査読付き学術誌 AIによる深掘り 回答品質・妥当性 国内の研究 生成質問の評価
回答の言葉と意味を手掛かりに、次の深掘りを作る 成蹊大学の研究。人間同士の料理嗜好インタビュー118対話を基に、対話履歴からインタビュアーの発話意図と意味内容を生成し、GPT-3をfine-tuningした。主観評価では、提案モデルはzero-shot ChatGPTと応答文だけを直接生成するモデルより、回答者の情報を引き出そうとしている印象を与えた。
意味内容に基づくインタビュアー応答生成モデルの作成と評価―対話による食に関するユーザ嗜好の獲得―
曽 傑, 中野 有紀子, 坂戸 達陽 · 人工知能学会論文誌, 39(3), IDS6-A_1–15
研究方法・結果・限界を見る 研究方法 料理嗜好についてのテキスト対話118件を収集・アノテーションし、提案モデル、zero-shot ChatGPT、直接応答生成GPT-3、実際の人間応答を比較。ランキング評価はクラウドワーカー30人が一人当たり47セットを評価し、質問項目評価には別のクラウドワーカー160人を用いた。 対象・規模 学習・分析用に人間同士のテキストインタビュー118対話。生成応答の評価はランキング30人と質問項目評価160人(いずれもクラウドソーシング)。 報告された結果 提案モデルはベースライン2種より、ユーザ情報を引き出そうとしている印象で高く評価され、人間の実際のインタビュアー応答と同等の印象だった。ChatGPTより、回答で言及された語や連想内容を詳細に尋ねる質問を多く生成した。 読み取りの限界 評価の中心は生成文への主観評価で、実際にAIと長時間対話した人から得られる情報量・正確性の直接比較ではない。対象は食嗜好に限られ、GPT-3と当時のzero-shot ChatGPTの比較である。 確認した範囲 J-STAGE原典PDFの全文を確認 発表情報 人工知能学会論文誌の原著論文。2024年5月1日発行。 DOI:10.1527/tjsai.39-3_IDS6-A
最終確認:2026-09-13
原典を読む ↗ 2024年 査読付き会議論文 AIによる深掘り 回答品質・妥当性 調査モード比較 国内の研究
GPT-4の追質問で、商品レビューを書きやすくする 電気通信大学の研究。GPT-4のインタビュー対話が商品の長所・短所を追質問し、その内容からレビューと評価を生成する。各条件100人の比較で、文脈依存の追質問を行う条件は固定9問の条件より楽しいと評価され、満足できるレビューにするのに50%以上の書き直しが必要と答えた割合も小さかった。
User Review Writing via Interview with Dialogue Systems
Yoshiki Tanaka, Michimasa Inaba · Proceedings of the 25th Annual Meeting of the Special Interest Group on Discourse and Dialogue, 428–439
研究方法・結果・限界を見る 研究方法 GPT-4(gpt-4-0613)の動的インタビュー対話と、固定順序の手作業9質問ベースラインを比較。インタビューは最低8問・最大15ターンとし、対話後に生成レビュー・予測評価を提示して利用者評価を収集。さらに第三者がレビューを評価した。 対象・規模 各条件100人、計200人。AU/CA/NZ/GB/US所在で承認率95%以上・承認HIT 500件以上のMTurk参加者。第三者評価には別途MTurkアノテータを用いた。 報告された結果 動的インタビューは楽しさで固定質問より有意に高かった(Mann–Whitney U検定、p<.05)。50%以上の書き直しが必要と答えた割合は固定質問38%、動的インタビュー27%。ただし動的方式は応答生成待ちのため、レビュー作成の負担を高めた。 読み取りの限界 英語での商品のレビュー作成という用途に限定され、日本語対話の検証ではない。参加者は英語圏のMTurkワーカーで、研究機関は日本だがサンプルは日本ではない。生成速度が体験を損ね、生成レビューの主観性と予測評価のずれも残った。 確認した範囲 ACL Anthology原典PDFの全文を確認 発表情報 SIGDIAL 2024の会議論文。ACL Anthologyに掲載。DOIは掲載ページで示されていない。 最終確認:2026-09-13
原典を読む ↗ 2024年 研究会報告 音声・アバター AIによる深掘り 回答品質・妥当性 国内の研究
姿勢と声から話す意欲を推定し、話題を選ぶ 北陸先端科学技術大学院大学のインタビューロボット研究。姿勢と発話韻律からユーザの発話意欲を推定し、話題を継続するか転換するかを選んで質問する。27人とのインタビューで、提案戦略はランダムな話題転換・継続より、意欲が高い発話の割合を有意に増やした。
発話意欲推定に基づく適応的対話戦略を備えたインタビューロボット対話システム
長澤 史記, 岡田 将吾 · 人工知能学会研究会資料 言語・音声理解と対話処理研究会, 第100回, 204–209
研究方法・結果・限界を見る 研究方法 マルチモーダル特徴からの発話意欲推定モデルを交差検証し、推定に応じて話題転換・継続を選ぶ質問戦略とランダム選択をインタビュー対話で比較。 対象・規模 インタビュー対話の評価対象27人。 報告された結果 ランダムフォレストによる発話意欲(高・低)の推定精度は72.8%。適応的質問選択戦略は、ランダム戦略より意欲の高い発話の割合を有意に増やした。 読み取りの限界 研究会資料であり査読付き論文として扱えない。公開抄録で確認できる結果は発話意欲と割合で、回答内容の正確性・情報量・長期利用は確認していない。 確認した範囲 J-STAGEの書誌・抄録を確認(本文未確認) 発表情報 人工知能学会の研究会資料(第100回)。査読付き会議論文には分類しない。 DOI:10.11517/jsaislud.100.0_204
最終確認:2026-09-13
原典を読む ↗ 2024年 査読付き学術誌 自己開示・バイアス 調査モード比較 回答品質・妥当性
自己評価では差がなくても、人の採点では開示の深さに差 音楽祭で人間またはボットに秘密を打ち明けてもらう実験。開示の深さの自己評価に差はなかったが、第三者の採点では人間相手の方が深かった。評価される不安はボットで低く、聞き手への信頼は人間で高かった。
Digital Confessions: The Willingness to Disclose Intimate Information to a Chatbot and its Impact on Emotional Well-Being
Emmelyn A. J. Croes, Marjolijn L. Antheunis, Chris van der Lee, Jan M. S. de Wit · Interacting with Computers, 36(5), 279–292
研究方法・結果・限界を見る 研究方法 聞き手と共感応答の2×2条件へ無作為割当。双方ともDiscordで同じ台本を使用。ボットは辞書・感情分析から事前作成応答を選ぶ方式。 対象・規模 2019年の音楽祭参加者286人(16〜61歳)。空の告白は内容分析から除外。 報告された結果 自己評価の条件差は非有意。内容の採点では人間2.34、ボット2.04で人間が高かった。開示による安堵の向上は支持されなかった。 読み取りの限界 自発参加の祭典来場者で高学歴者に偏る。人間条件もテキスト対話で、対面比較ではない。現代LLMの評価ではなく、自己評価と内容評価も同一視できない。 確認した範囲 出版社本文の書誌・方法・結果・限界を確認 発表情報 2024-06-12公開、同年9月号掲載。調査実施は2019年。 DOI:10.1093/iwc/iwae016
最終確認:2026-09-14
原典を読む ↗ 2022年 査読付き学術誌 AIによる深掘り 回答品質・妥当性 国内の研究
正しい暗黙確認でも、繰り返せば聞かれ疲れを生む 大阪大学らが、知らない語の属性を聞き出す質問への印象を調査。推測した内容を会話に織り込む確認は、正しいと好印象だが、誤ると悪印象になる。同じ形式を続ける煩わしさも示した。
User Impressions of System Questions to Acquire Lexical Knowledge during Dialogues
Kazunori Komatani, Kohei Ono, Ryu Takeda, Eric Nichols, Mikio Nakano · Dialogue & Discourse, 13(1), 96–122
研究方法・結果・限界を見る 研究方法 語の属性を確認する対話で、質問の形式、内容の正誤、反復とユーザー印象の関係を分析。 対象・規模 クラウドソーシング参加者104人の印象評価。 報告された結果 内容が正しい暗黙の確認は好印象だったが、同じ質問形式を繰り返すと、内容が正しくても印象が下がった。 読み取りの限界 未知語の属性取得という制約された実験。自由な半構造化面接、回答の真実性、洞察量や長期の対話成果を測ったものではない。 確認した範囲 Dialogue & Discourseの原典PDF全文を確認 発表情報 査読付き学術誌掲載。SIGDIAL 2020論文の改訂・拡張版であるため、2020年版は別レコードにしない。 DOI:10.5210/dad.2022.104
最終確認:2026-09-14
原典を読む ↗ 2021年 査読付き学術誌 AIによる深掘り 回答品質・妥当性 国内の研究
料理の好みを、文脈を保ちながら聞き出す 成蹊大学の研究。料理嗜好を聞き出す日本語テキスト対話で、知識グラフと話題埋め込みを使って関連話題へ質問を広げる。クラウドワーカーとの実対話で、単なるベースラインより一つの料理から会話を長く継続でき、対話破綻が少ない条件では話題の多様性・文脈継続性が高く評価された。
知識と話題の埋め込み表現に基づく質問生成と対話システムへの適用―料理嗜好インタビューシステムに向けて―
曽 傑, 中野 有紀子 · 自然言語処理, 28(2), 598–631
研究方法・結果・限界を見る 研究方法 3条件(ベースライン、話題埋め込み、話題埋め込み+知識グラフ補完)を同一参加者が全て体験する被験者内のweb対話実験。料理・材料の話題選択と質問生成を比較した。 対象・規模 クラウドソーシング募集48人。対話履歴不備1人と同一回答を30回以上繰り返した1人を除く46人を分析。全員が3条件を実施。 報告された結果 提案方法は一つの料理から派生する話題をより長く継続した。対話破綻が2回以下の10人に限る分析では、話題の多様性と文脈継続性に有意差または傾向差が示された。 読み取りの限界 主観評価の改善は対話破綻が少ない10人の分析で主に確認され、全参加者で一様に改善した結果ではない。料理嗜好という限定領域・テキスト対話・クラウドサンプルでの検証である。 確認した範囲 J-STAGE原典PDFの全文を確認 発表情報 査読付き学術誌。J-STAGEには受付日2020-10-31、受理日2021-03-12、発行年2021が記録されている。 DOI:10.5715/jnlp.28.598
最終確認:2026-09-13
原典を読む ↗ 2020年 査読付き学術誌 調査モード比較 回答品質・妥当性 AIによる深掘り
自由記述の調査で、対話は回答の具体性を高めるか ゲーム予告編への反応を、Jujiの対話型調査とQualtricsの通常調査で比較。対話型では情報量・関連性・具体性・明確さが高かったと報告した。
Tell Me About Yourself: Using an AI-Powered Chatbot to Conduct Conversational Surveys with Open-ended Questions
Ziang Xiao, Michelle X. Zhou, Q. Vera Liao, Gloria Mark, Changyan Chi, Wenxi Chen, Huahai Yang · ACM Transactions on Computer-Human Interaction, 27(3), Article 15
研究方法・結果・限界を見る 研究方法 同じ設問を用いる実地比較。自由記述を人手で評価した。募集・対象群の選び方を研究者が完全に統制した無作為化実験ではない。 対象・規模 完了582件(対話型282、通常調査300)。18〜50歳のゲーム利用者で、自由記述5,200件超を分析。 報告された結果 対話型では回答品質の各指標と自己開示が高く、完了までの時間も平均約7分長かった。 読み取りの限界 募集文面を途中で変更している。若いゲーム利用者と特定テーマへの偏りがあり、各対話機能の個別効果や現在のLLMの性能は切り分けていない。 確認した範囲 著者・大学公開の原典本文で、方法・結果・限界を確認 発表情報 2020年6月掲載。arXiv初版2019年と同じ研究のため重複登録しない。 DOI:10.1145/3381804
最終確認:2026-09-13
原典を読む ↗ 2020年 査読付き会議論文 AIによる深掘り 回答品質・妥当性 調査モード比較
傾聴を加えると、回答の質と会話体験は変わるか 言い換えや感情の受け止めなどの傾聴機能を持つチャットボットと、同じ質問をする基本版を比較。傾聴版では回答の質と会話体験の評価が高かった。
If I Hear You Correctly: Building and Evaluating Interview Chatbots with Active Listening Skills
Ziang Xiao, Michelle X. Zhou, Wenxi Chen, Huahai Yang, Changyan Chi · CHI Conference on Human Factors in Computing Systems (CHI 2020)
研究方法・結果・限界を見る 研究方法 米国・カナダの参加者を2種類のチャットボットへ無作為割当。4テーマを同じ順序で質問し、回答品質と自己評価を比較。 対象・規模 完了206人(傾聴版108、基本版98)。824回答を人手で評価。 報告された結果 平均回答語数は125.70対100.65、回答品質指標は21.28対16.83。傾聴版は長く会話し、理解されている感覚の評価も高かった。 読み取りの限界 傾聴の各技法の効果は個別に切り分けていない。学習データにない悩みの理解や、複数テーマ間の情報共有に弱点が残る。現代の生成LLMそのものの比較ではない。 確認した範囲 著者・大学公開の原典本文で、方法・結果・限界を確認 発表情報 CHI 2020の査読付き本会議論文。著者公開原稿とarXivの採録情報・関連DOIを照合。 DOI:10.1145/3313831.3376131
最終確認:2026-09-13
原典を読む ↗ 2020年 査読付き学術誌 音声・アバター AIによる深掘り 回答品質・妥当性 採用面接の体験 国内の研究
ERICAの掘り下げ質問は、面接練習をどこまで本番に近づけるか 京都大学らが、回答の充足度とキーワードから掘り下げ質問を出すERICAを、固定質問だけの条件と比較。大学生は掘り下げ版を面接練習として高く評価した。採用選考の精度を測る研究ではない。
A Job Interview Dialogue System That Asks Follow-up Questions: Implementation and Evaluation with an Autonomous Android
Koji Inoue, Kohei Hara, Divesh Lala, Kenta Yamamoto, Shizuka Nakamura, Katsuya Takanashi, Tatsuya Kawahara · 人工知能学会論文誌, 35(5), D-K43_1–10
研究方法・結果・限界を見る 研究方法 大学生22人が回答を準備し、両システムとの面接練習をランダム順で経験。19項目の7段階評価と4項目の比較選好を回答。 対象・規模 大学生22人(女性8人、男性14人)。全員が提案・ベースラインの両システムと対話した被験者内比較。 報告された結果 良い練習という選好は提案19対基本3、回答理解は20対2、再利用は17対5。適切な質問の選好14対8には有意差がなかった。 読み取りの限界 小規模な練習場面の主観評価。採用結果や長期の学習効果、現在のLLMの性能は検証していない。両条件ともERICAであり、身体性そのものの効果も測っていない。 確認した範囲 J-STAGE原典の書誌・抄録と、原典PDFの被験者・手順・結果表の本文を確認 発表情報 査読付き原著論文。J-STAGE掲載日は2020-09-01。 DOI:10.1527/tjsai.35-5_D-K43
最終確認:2026-09-14
原典を読む ↗ 2019年 査読付き会議論文 調査モード比較 回答品質・妥当性
会話形式と文体で、回答の偏りは変わるか 韓国の若年層117人を、web/Facebook Messenger botと、フォーマル/カジュアル文体の2×2条件に割り当てた実験。botでは回答の分化が大きく、手抜き回答が少なかったが、その利点はカジュアル文体で主に現れた。完了時間はbotの方が長く、実験参加者に限られるため、一般的な調査運用への外挿は慎重であるべきだ。
Comparing Data from Chatbot and Web Surveys: Effects of Platform and Conversational Style on Survey Response Quality
Soomin Kim, Joonhwan Lee, Gahgene Gweon · CHI Conference on Human Factors in Computing Systems (CHI 2019)
研究方法・結果・限界を見る 研究方法 2(web対text chatbot)×2(フォーマル対カジュアル)の被験者間無作為化実験。同じインターネット利用質問票に回答させ、回答分化、離脱、使いやすさ、楽しさ、自由記述を比較。 対象・規模 韓国の青年117人(平均17.81歳、女性51%)。Facebook Messengerとweb surveyの経験者。完了データ106件を分析。 報告された結果 chatbot条件はweb条件より回答分化が高く、satisficingが少なかった。カジュアルな語り口の効果はchatbotでのみ顕著。離脱差は有意でなく、webの平均完了時間17分30秒に対しchatbotは26分44秒だった。 読み取りの限界 自発的に実験へ参加する若年・メッセンジャー経験者に限定され、低い離脱率やカジュアル文体の評価は一般集団・高齢層・実運用に一般化できない。 確認した範囲 原典の全文を確認 発表情報 査読付き会議論文(ACM CHI 2019) DOI:10.1145/3290605.3300316
最終確認:2026-09-13
原典を読む ↗ 2019年 査読付き会議論文 継続調査・現場導入 回答品質・妥当性
学生の希望とチーム経験を、学期の前後に聞く 大学の授業でINDIGOが学生に希望する役割やチーム経験を質問。学期前後の対話から、授業運営に使う個別の情報を収集した実地研究。
Who Should Be My Teammates: Using A Conversational Agent to Understand Individuals and Help Teaming
Ziang Xiao, Michelle X. Zhou, Wai-Tat Fu · International Conference on Intelligent User Interfaces (IUI 2019)
研究方法・結果・限界を見る 研究方法 米国大学の授業で学期の最初と最後にテキスト面接を実施。対話から推定した特性とチームの成績・経験の関係も分析した。 対象・規模 履修201人中、研究参加に同意した184人。授業全体は約40チーム。 報告された結果 チームの希望・期待・振り返りを聞き取れ、推定したチーム構成と成果の関連を報告した。面接には長時間を要する場合や入力理解の不具合もあった。 読み取りの限界 一大学の一学期の授業。性格推定の正しさや職場での人員配置効果を実証したものではない。チーム成績との関連をAI面接による改善効果と解釈しない。 確認した範囲 著者・大学公開の原典本文で、方法・結果・限界を確認 発表情報 IUI 2019の会議論文。著者公開原稿の書誌・対象人数を確認。 DOI:10.1145/3301275.3302264
最終確認:2026-09-13
原典を読む ↗ 2018年 査読付き学術誌 自己開示・バイアス 音声・アバター 調査モード比較
人間らしい会話は、本音より建前を増やすのか 会話エージェントの身体性と会話の関連性を操作し、対面面接・オンライン調査とも比較した実験。敏感な質問では、会話の関連性が高いエージェントほど、参加者はより社会的に望ましい回答をした。人間らしい会話は回答を深める可能性がある一方、正直さを自動的に高めるわけではなく、敏感領域では測定バイアスを増やす危険を示す。
The influence of conversational agent embodiment and conversational relevance on socially desirable responding
Ryan M. Schuetzler, Justin S. Giboney, G. Michael Grimes, Jay F. Nunamaker Jr. · Decision Support Systems, 114, 94–102
研究方法・結果・限界を見る 研究方法 実験室実験で、会話関連性と身体性の異なる会話エージェントへの回答を、対面面接およびオンライン調査と比較。敏感・非敏感質問の回答を社会的望ましさの観点から分析。 対象・規模 参加人数は、確認できた出版社要旨・書誌ページからは特定できなかった。 報告された結果 敏感な質問において、会話能力(関連性)の高いエージェントは社会的に望ましい回答をより引き出した。身体性の効果はより小さかった。 読み取りの限界 確認済みの公開要旨ではサンプル数、設問内容、効果量を検証できない。結果は『開示量』でなく社会的望ましさという測定バイアスを中心に扱う。 確認した範囲 原典の抄録・書誌情報を確認(本文詳細は未確認) 発表情報 査読付き誌掲載(Decision Support Systems) DOI:10.1016/j.dss.2018.08.011
最終確認:2026-09-13
原典を読む ↗ 2018年 査読付き会議論文 継続調査・現場導入 調査モード比較
出来事の直後に聞く対話型の現場調査 イベントを巡る人にスマートフォンのボットが質問し、その場の体験や写真を収集。事後の人間による聞き取りと、得られる情報の違いを検討した。
The Ethnobot: Gathering Ethnographies in the Age of IoT
Ella Tallyn, Hector Fried, Rory Gianni, Amy Isard, Chris Speed · CHI Conference on Human Factors in Computing Systems (CHI 2018), Paper 604
研究方法・結果・限界を見る 研究方法 Royal Highland Showで事前設定した対話フローを運用し、チャット記録と終了後の短い人間面接を質的に分析。 対象・規模 参加者13人、現場での運用は2日間。収集した活動記録の時間は合計26時間。 報告された結果 その場の細かな事実は記録できた一方、感情は事後の人間面接でより語られた。選択肢の制約や移動先の指定への不満も見られた。 読み取りの限界 小規模な現場研究で、調査時点や入力方法が異なるため聞き手だけの因果効果ではない。個別回答に応じた深掘りができない従来型ボットであり、現代LLMの能力評価ではない。 確認した範囲 著者・大学公開の原典本文で、方法・結果・限界を確認 発表情報 CHI 2018の査読付き会議論文。エディンバラ大学の刊行版PDFと書誌情報を確認。 DOI:10.1145/3173574.3174178
最終確認:2026-09-13
原典を読む ↗ 2017年 査読付き学術誌 自己開示・バイアス 音声・アバター 調査モード比較
症状を話しやすくする効果と、比較条件の限界 米軍の現役・退役軍人に、仮想人間が音声で症状を質問した2研究。小標本では質問票より症状の申告が増えたが、大きい標本の単純比較は有意水準に届かなかった。
Reporting Mental Health Symptoms: Breaking Down Barriers to Care with Virtual Human Interviewers
Gale M. Lucas, Albert Rizzo, Jonathan Gratch, Stefan Scherer, Giota Stratou, Jill Boberg, Louis-Philippe Morency · Frontiers in Robotics and AI, 4, Article 51
研究方法・結果・限界を見る 研究方法 同じ人の質問票と仮想面接への回答を比較。研究1は公式・匿名質問票、研究2は匿名質問票を比較対象とし、自由発話を人が有無へ分類した。 対象・規模 研究1は29人募集・24人分析。研究2は132人募集、両評価完了126人。 報告された結果 研究1では公式・匿名質問票の双方より申告数が多かった。研究2の単純比較はp=0.08で、症状尺度を考慮した分析とは区別が必要。 読み取りの限界 匿名質問票が先という順序、自由回答と選択式の違いが残る。申告増加を診断精度や治療効果の証明としない。現在の生成LLMの研究ではない。 確認した範囲 出版社本文の書誌・両研究の方法・結果・考察を確認 発表情報 2017-10-12公開の原著論文。既存のLucas 2014とは対象・実験が異なる。 DOI:10.3389/frobt.2017.00051
最終確認:2026-09-14
原典を読む ↗ 2016年 学会発表 AIによる深掘り 回答品質・妥当性 国内の研究
食事記録の聞き取りに雑談を挟む 電気通信大学とHonda Research Institute Japanの研究。食事内容を聞くテキスト型インタビューで、回答後に雑談を挟む対話管理を提案した。ユーザスタディでは、雑談を入れないインタビューより良い印象を与えたと報告した。
雑談を行うことでユーザの印象を向上させるインタビュー対話システム
小堀 嵩博, 中野 幹生, 中村 友昭 · 2016年度人工知能学会全国大会(第30回)論文集, 3P1-5in2
研究方法・結果・限界を見る 研究方法 雑談を挟まない条件、1回挟む条件、3回挟む条件を同一参加者がランダム順で体験。1対話は最大33ターンで、楽しさ・自然さ等を5段階評価。 対象・規模 クラウドワーカー100人が3種類のシステムを体験。途中終了や同一発話の反復等を除いた92人を分析。 報告された結果 雑談を1回挟む条件は楽しさ・温かさなどで良い評価を得た。一方、3回挟む条件は雑談なしより自然さの評価が低く、雑談を増やせば改善する結果ではなかった。 読み取りの限界 全国大会論文集であり査読付き論文とは区別する。食事を聞く短いテキスト対話に限定され、言語理解や雑談のつながりに課題が残る。実際の食事情報の正確性を実証する研究ではない。 確認した範囲 J-STAGEの原典PDF全4ページを確認。人数と条件は第5節、限界は第5.4節。 発表情報 人工知能学会全国大会の会議録・要旨集。査読付き会議論文には分類しない。 DOI:10.11517/pjsai.JSAI2016.0_3P15in2
最終確認:2026-09-13
原典を読む ↗ 2015年 査読付き学術誌 音声・アバター AIによる深掘り 回答品質・妥当性 架空シナリオでの検証
アバターの表情より、質問を助ける対話力が重要 画面上の仮想面接者の対話能力と顔の動きを操作した、73人の実験室調査。曖昧な設問を助ける対話能力が高いと、参加者は確認質問を増やし、複雑なシナリオで正答率が上がった。顔の動きは関与のしぐさを増やしたが、正答率には寄与せず自然さの評価を下げた。見た目の人間らしさと、理解を支える会話機能は別に検証すべきことを示す。
Comprehension and engagement in survey interviews with virtual agents
Frederick G. Conrad, Michael F. Schober, Matt Jans, Rachel A. Orlowski, Daniel Nielsen, Rachel M. Levenstein · Frontiers in Psychology, 6, 1578
研究方法・結果・限界を見る 研究方法 2(高/低の対話能力、人間が裏側で対話を操作するWizard-of-Oz法)×2(高/低の顔アニメーション)×2(単純/複雑な架空シナリオ)。米国政府調査の住宅・雇用・購買に関する12設問へ回答し、定義との一致を正確性とした。 対象・規模 分析対象73人。仮想面接者の4条件へ無作為割当し、裏側の人間による操作に気づかなかった参加者を分析。 報告された結果 高い対話能力では正答率74.3%、低い対話能力では60.2%。特に複雑なシナリオで差が大きく、確認要求も増えた。顔アニメーションは関与行動を増やしたが、正答率には影響せず、より不自然と評価された。 読み取りの限界 架空シナリオにより正確性を直接測れた一方、自己の生活を答える実調査とは生態学的妥当性が異なる。Wizard-of-Ozの能力であり自律AIの性能を直接測った研究ではない。 確認した範囲 原典の全文を確認 発表情報 査読付き誌掲載(Frontiers in Psychology) DOI:10.3389/fpsyg.2015.01578
最終確認:2026-09-13
原典を読む ↗ 2014年 査読付き学術誌 自己開示・バイアス 音声・アバター
『AIが聞く』と思うと、人はより打ち明けるのか 健康スクリーニングで、仮想人間の操作主体を「自動」または「人間」と説明した実験。自動だと信じる条件では、開示への恐れや印象管理が低く、観察者が評価した開示意欲が高かった。実際の操作方式とは別に、誰が見ていると思うかを検証した。
It’s only a computer: Virtual humans increase willingness to disclose
Gale M. Lucas, Jonathan Gratch, Aisha King, Louis-Philippe Morency · Computers in Human Behavior, 37, 94–100
研究方法・結果・限界を見る 研究方法 説明(自動/人間)×実際の操作(自律AI/人間による遠隔操作)の2×2設計。説明を無作為割当し、質問票、表情、面接記録を評価。実際の操作方式は説明とは独立に設定された。 対象・規模 239人募集(18〜65歳)。操作担当者への条件露見・説明の理解チェックで除外後154人、さらにAI不具合9件を除外して145人。欠測により指標別の分析人数は異なる。 報告された結果 「自動」と説明した条件では開示意欲が高かった。実際の操作方式の主効果と、説明との交互作用は有意でなかった。 読み取りの限界 説明の理解チェック不合格者などを除外した分析で、回答の真偽を直接検証していない。健康スクリーニングと従来型仮想人間の研究であり、人間との対面面接や現在のLLMとの直接比較ではない。 確認した範囲 著者の大学公開PDFの方法・結果・考察を確認。旧抄録のみの記録から、2×2設計と対象人数を補足。 発表情報 査読付き誌掲載(2014年8月号) DOI:10.1016/j.chb.2014.04.043
最終確認:2026-09-14
原典を読む ↗