マルチモーダルAIとは?

マルチモーダルAIとは、テキストだけでなく画像・音声・動画など複数の形式(モダリティ)の情報をまとめて理解・生成できるAIのこと。「この請求書の画像から金額を読み取って」のような指示が可能になります。

実務での使い方

業務では、帳票・レシートの読み取り、グラフや図の説明、会議音声の文字起こし+要約、商品画像からの説明文生成などが実用例です。従来はOCRや音声認識など個別のシステムが必要だった処理を、1つのAIで扱えるようになりました。

注意点は、画像内の文字や数値の読み取り精度は完璧ではないことです。金額や契約条件など間違いが許されない項目は人間の確認を挟む、読み取り結果を元データと突合する、といった運用でカバーします。

関連用語

最終更新: ・ 作成:Digital Sales 編集部

← 用語集の一覧に戻る