
田中専務
拓海先生、最近部下から「画像内の文字認識で精度が出ない」と聞きまして、現場写真だと文字の大きさがバラバラで困っているそうです。こういうのってAIでどうにかなるものですか。

AIメンター拓海
素晴らしい着眼点ですね!大丈夫、文字の大きさがバラバラだと普通の認識器は迷子になりがちです。今回紹介する手法は「文字サイズの差」を明示的に扱って、正しく特徴を抽出できるようにするんですよ。

田中専務
なるほど。でも具体的に何が新しいのですか。これまでのCNNでサイズ合わせして学習するのと何が違うのでしょうか。

AIメンター拓海
端的に言えば、従来は入力画像を無理やり一つのサイズに揃えてからCNNで特徴を取っていたのに対し、この論文はマルチスケールで特徴を取り、どのスケールが適切かを注意(attention)で選ぶ仕組みを入れているんです。重要なポイントを3つでまとめると、1) マルチスケールで特徴を抽出する、2) スケールを選ぶ注意機構を導入する、3) 既存の認識器にも組み込みやすいこと、です。

田中専務


