2 分で読了
0 views

人間評価と統計評価を統一する指標の提案

(Unifying Human and Statistical Evaluation for Natural Language Generation)

さらに深い洞察を得る

AI戦略の専門知識を身につけ、競争優位性を構築しませんか?

AIBR プレミアム
年間たったの9,800円で
“AIに詳しい人”として
一目置かれる存在に!

プレミア会員になって、山ほどあるAI論文の中から効率よく大事な情報を手に入れ、まわりと圧倒的な差をつけませんか?

詳細を見る
【実践型】
生成AI活用キャンプ
【文部科学省認可】
満足度100%の生成AI講座
3ヶ月後には、
あなたも生成AIマスター!

「学ぶ」だけではなく「使える」ように。
経営者からも圧倒的な人気を誇るBBT大学の講座では、3ヶ月間質問し放題!誰1人置いていかずに寄り添います。

詳細を見る

田中専務

拓海さん、最近部下から「生成系AIの評価を見直すべきだ」と言われまして。要するに評価の話ですね、どこをどう見ればいいのか見当がつかないのですが。

AIメンター拓海

素晴らしい着眼点ですね!大丈夫、生成系AIの評価は一見ややこしいですが、要点は実はシンプルです。品質(quality)と多様性(diversity)の両方を同時に見る方法が肝心ですよ。

田中専務

品質は人に見せれば分かる。でも部下は「人だけでは足りない」と。これって要するに人間の目だけだと不正確だということですか?

AIメンター拓海

その通りですよ。人(human)評価は品質を見るのに強いが、モデルが訓練データを丸写ししているといった「多様性の欠如」を見落としがちです。逆に統計的評価、例えば困難度を示すperplexity(パープレキシティ、PPL)は多様性を見るが、たまに質の低い文を混ぜても罰が弱いのです。

田中専務

なるほど。両方のいいところを取るということですね。でも現場の時間も限られている。実務上、どこまで使える指標なんですか?

AIメンター拓海

大丈夫、一緒にやれば必ずできますよ。論文の提案するHUSE(Human Unified with Statistical Evaluation)は、人の判定を使いつつモデルの確率情報を組み合わせて、どれだけ「人とモデルを区別できるか」の誤判定率を測る手法です。実務では人手の評価を効率化しつつ多様性も検出できますよ。

田中専務

ちょっと具体例をお願いできますか。現場では「却って手間が増える」のを最も避けたいのです。

AIメンター拓海

まず要点を3つにまとめますね。1つ目は、人の判定で得た「この文は人が書いたか」を使って参照分布を推定すること。2つ目は、モデルがその文をどれだけ『出しやすい』かを確率で評価すること。3つ目は、この二つを2次元空間に置いて近傍法で判定精度を測ることです。実装は既存の評価データとモデル確率があれば組めますよ。

田中専務

それは要するに、人の判定とモデルの出力確率を掛け合わせて、機械と人の区別がどれだけ難しいかを数値にする、ということですか?

AIメンター拓海

その通りです!その数値をHUSEと呼びます。良い点は、これが多様性の欠如(訓練データの丸写し)も検出できる点で、単に人の好みだけで測るより実践的です。導入の第一歩は既存の人評価を少し拡張するだけで済みますよ。

田中専務

分かりました。まずは既存の評価データとモデルの確率を持ってきて試してみます。自分の言葉で言えば、品質と多様性を同時に見る効率的な指標、という理解でよろしいですか。

AIメンター拓海

素晴らしい着眼点ですね!その理解で合っていますよ。大丈夫、一緒にセットアップして、会議で説明できる資料まで作りますから安心してください。

監修者

阪上雅昭(SAKAGAMI Masa-aki)
京都大学 人間・環境学研究科 名誉教授

論文研究シリーズ
前の記事
ニュースキャスター音声を少量データで合成する二様式テキスト読み上げモデル
(In Other News: A Bi-style Text-to-speech Model for Synthesizing Newscaster Voice with Limited Data)
次の記事
Amazonレビューの深層感情分析と評価の整合性検出
(DEEP LEARNING SENTIMENT ANALYSIS OF AMAZON.COM REVIEWS AND RATINGS)
関連記事
大規模画像・信号における分散畳み込み辞書学習
(Distributed Convolutional Dictionary Learning (DiCoDiLe): Pattern Discovery in Large Images and Signals)
消極的人権を基盤とする長期的なAI安全と規制
(Negative Human Rights as a Basis for Long-term AI Safety and Regulation)
WindsorML:高忠実度自動車用計算流体力学データセット
(WindsorML: High-Fidelity Computational Fluid Dynamics Dataset For Automotive Aerodynamics)
チェスで多様な専門家を使って王手を仕留める:Mixture of ExpertsとMCTSの統合
(Checkmating One, by Using Many: Combining Mixture of Experts with MCTS to Improve in Chess)
階層的言語ラベルを用いた深層ニューラルネットワークの視覚表現学習
(Learning Hierarchical Visual Representations in Deep Neural Networks Using Hierarchical Linguistic Labels)
中国の企業登録ビッグデータの欠損補完による産業の時空間分析支援
(Big enterprise registration data imputation: Supporting spatiotemporal analysis of industries in China)
関連タグ
この記事をシェア

有益な情報を同僚や仲間と共有しませんか?

AI技術革新 - 人気記事
ブラックホールと量子機械学習の対応
(Black hole/quantum machine learning correspondence)
生成AI検索における敏感なユーザークエリの分類と分析
(Taxonomy and Analysis of Sensitive User Queries in Generative AI Search System)
DiReDi:AIoTアプリケーションのための蒸留と逆蒸留
(DiReDi: Distillation and Reverse Distillation for AIoT Applications)

PCも苦手だった私が

“AIに詳しい人“
として一目置かれる存在に!
  • AIBRプレミアム
  • 実践型生成AI活用キャンプ
あなたにオススメのカテゴリ
論文研究
さらに深い洞察を得る

AI戦略の専門知識を身につけ、競争優位性を構築しませんか?

AIBR プレミアム
年間たったの9,800円で
“AIに詳しい人”として一目置かれる存在に!

プレミア会員になって、山ほどあるAI論文の中から効率よく大事な情報を手に入れ、まわりと圧倒的な差をつけませんか?

詳細を見る
【実践型】
生成AI活用キャンプ
【文部科学省認可】
満足度100%の生成AI講座
3ヶ月後には、あなたも生成AIマスター!

「学ぶ」だけではなく「使える」ように。
経営者からも圧倒的な人気を誇るBBT大学の講座では、3ヶ月間質問し放題!誰1人置いていかずに寄り添います。

詳細を見る

AI Benchmark Researchをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む