
マルチモーダルAIとは、産業技術総合研究所の解説(産総研マガジン)の言葉を借りれば、異なる種類の情報をまとめて扱うAIのことになります。ChatGPTやGeminiに写真・録音・PDFをそのまま渡せるのもこの性質によるもので、便利な反面、文字で打ち込むよりも多くの情報が一度にAIへ渡ってしまいます。入れる前に何を確かめるかを会社で決めておけば、便利さを手放さずに使うことが出来ます。
マルチモーダルAIとは|異なる種類の情報をまとめて扱うAI
マルチモーダルAIは、文字だけ、画像だけといった1種類の情報ではなく、複数の種類を組み合わせて理解したり出力したりするAIを指します。産総研マガジン(2023年11月29日)では、「異なる種類の情報をまとめて扱うAIのことです」と説明されています。扱う情報の代表は、文字(テキスト)、画像、音声、動画の4つになります。人も相手の表情と声の調子を合わせて話の意味をつかんでいるため、それに近い理解の仕方をAIにさせる考え方と言い換えることも出来ます。
モダリティとは|データの種類を指す言葉と語源
モダリティ(modality)は、情報の種類や、情報が伝わる経路を指す言葉になります。マルチモーダル(multimodal)は、「複数の」を意味するmultiと、「様式の」を意味するmodalを組み合わせた語です。文字・画像・音声がそれぞれ1つのモダリティにあたり、これを2つ以上扱えるAIがマルチモーダルAIと呼ばれています。
複数のAIを使い分ける「マルチAI」とは別の言葉
名前が似ている言葉に、ChatGPT・Claude・Geminiなど複数の生成AIを1つの環境で使い分けるマルチAIがあります。マルチモーダルの「マルチ」は情報の種類の数を、マルチAIの「マルチ」はAIサービスの数を指しており、話している中身が違います。複数のAIをまとめて使う形についてはマルチAIとはで詳しく扱っています。
シングルモーダルAI(ユニモーダル)との違い
違いは、扱える情報の種類が1つか、複数かという点にあります。シングルモーダルAI(ユニモーダルAIとも呼ばれます)は、文字だけを読む翻訳AI、画像だけを見る画像認識AI、音声だけを聞く音声認識AIのように、1種類の情報に特化したAIになります。
- 扱う情報:シングルモーダルAIは1種類、マルチモーダルAIは文字・画像・音声・動画など複数
- 得意なこと:シングルモーダルAIは決まった1つの作業、マルチモーダルAIは複数の情報を突き合わせる判断
- 身近な例:シングルモーダルAIは文字起こしソフトや翻訳ソフト、マルチモーダルAIは写真を見せて質問できる対話型AI
- 学習に必要なもの:シングルモーダルAIは1種類のデータ、マルチモーダルAIは種類の違うデータを組にしたもの
1種類に絞る分、シングルモーダルAIは得意な作業では仕組みが単純で、動かす負担も軽く済みます。一方で、写真に写った文字と周りの状況を合わせて判断する、といった作業は苦手です。マルチモーダルAIは、複数の情報を突き合わせることで、1種類では分からない関係まで読み取れる点が強みとなります。
マルチモーダルAIの仕組み
仕組みの骨組みは、種類の違う情報を同じ形の数値に直し、1つにまとめてから判断するという流れになります。
各データの特徴を数値(ベクトル)にして統合する
文字・画像・音声は、そのままではAIの中で比べることが出来ません。そこで、それぞれの情報から特徴を取り出し、ベクトルと呼ばれる数値の並びに変換します。数値の形がそろえば、写真の中の犬と「犬」という単語を、近い意味のものとして結びつけられるようになります。
統合のタイミング|早い段階でまとめるか、遅い段階でまとめるか
複数の情報をどの段階でまとめるかには、大きく2つの考え方があります。早い段階でまとめる方式は、変換した直後の情報を混ぜてから処理するため、情報どうしの細かな関係を拾いやすい反面、計算量が増えやすい方式です。遅い段階でまとめる方式は、種類ごとに判断を出してから最後に合わせるため、作りやすく、どれか1つの情報が欠けても動かしやすいとされています。その中間の段階でまとめる方式もあり、どれを選ぶかは目的によって変わります。
共起関係から学ぶため、ラベル付けの手間が減る
共起関係とは、同じ場面に一緒に現れる情報どうしの結びつきを指す言葉になります。たとえば動画では、犬が映る場面で吠える声が聞こえることが多く、この一緒に現れる関係から、AIは犬の姿と鳴き声を結びつけて学ぶことが出来ます。従来は、画像1枚ごとに「これは犬」と人が名札(ラベル)を付けて教える必要があり、その準備に大きな手間がかかっていました。共起関係を手がかりにすれば、名札のないデータからも学べるため、ラベル付けの手間を減らせることが、マルチモーダルAIの学び方の特徴になります。産総研マガジンでも、ラベル付けのコストを削減できると考えられる、と説明されています。ただし、そのぶん大量のデータと計算が必要になる点は、後の課題の節で触れます。
生成AI・大規模言語モデルとの関係
生成AIとマルチモーダルAIは別の軸の言葉で、重なる部分は大きいものの、同じ意味ではありません。生成AIは文章や画像を新しく作るAIを指し、マルチモーダルAIは扱う情報の種類が複数あるAIを指します。ChatGPTのような対話型AIの中心にある大規模言語モデル(LLM)は、もともと文字を読んで文字を返すシングルモーダルの仕組みでした。そこに画像や音声を読み取る仕組みが加わり、主な対話型AIは写真やPDF、音声を受け付けるマルチモーダルな生成AIとして提供されるようになりました。OpenAIの公式ヘルプでも、画像入力は無料プランと有料プランのどちらでも使え、すべてのChatGPTモデルで画像を受け付けると書かれています。反対に、生成AIでも文字だけを扱うものはシングルモーダルに分類されます。
代表的なサービス|ChatGPT・Claude・Gemini・Perplexity・Microsoft Copilot
会社で触れる機会が多いマルチモーダルAIは、ChatGPT、Claude、Gemini、Perplexity、Microsoft Copilotといった対話型のサービスになります。このうちChatGPT・Claude・Gemini・Perplexityの4つは、公式ヘルプに添付できるファイルの種類が書かれており、受け付ける形式と上限はサービスごとに違います。次の一覧は、4つのサービスについて各社の公式ヘルプに書かれている内容をまとめたものです。
| サービス | 入れられるもの | 主な上限 | 知っておきたい点 |
|---|---|---|---|
| ChatGPT | 画像(PNG・JPEG・アニメーションなしのGIF)、文書ファイル、CSV・スプレッドシート、動画ファイル | 1ファイル512MB、画像は1枚20MB、文書は1ファイル200万トークン、CSV・スプレッドシートは約50MB。アップロードは3時間ごとに80ファイルまで(Freeは1日3ファイル) | PDFのビジュアル検索に対応するのはEnterpriseで、ほかのプランは文字だけを取り出し画像は破棄。日本語など非ラテン文字を含む画像は性能が下がると記載 |
| Claude | 文書(PDF、DOCX、CSV、TXT、HTML、ODT、RTF、EPUB、JSON、XLSX)、画像(JPEG、PNG、GIF、WebP) | 1ファイル500MB、1つのチャットに20ファイル、画像は8000×8000ピクセル、PDFは1000ページまで(プロジェクトは1ファイル30MB) | PDFの図やグラフまで読むのは100ページ以下のPDF。対応形式の一覧に音声・動画ファイルは挙がっていない(会話の音声モードはベータ) |
| Gemini | 動画、音声、そのほかの対応形式のファイル | 1回の質問に10ファイル、動画は1ファイル2GB、そのほかは100MB。動画は合計5分、音声は合計10分(Google AI Pro・Ultraは動画1時間、音声3時間) | 動画と音声の長さの上限がプランで変わる |
| Perplexity | テキスト、コード、PDF、画像、音声、動画 | すべての形式で1ファイル40MB。Free・Pro・Maxはアップロード数に週ごとの枠あり | 音声は文字に起こし話者を区別。動画の映像の中身は索引化されず検索の対象外 |
※2026年9月26日時点で、各社の公式ヘルプ(ChatGPT:ファイルアップロードFAQ・画像入力FAQ、Claude:アップロードできる文書とファイルの種類、Gemini:ファイルのアップロード、Perplexity:File uploads)に書かれている内容です。上限は混雑状況やプランによって変わることがあります。Microsoft Copilotの対応形式と上限は、利用しているプランの公式ヘルプでご確認ください。
Microsoft Copilotも、代表的なマルチモーダルAIとして名前が挙がることが多いサービスになります。どのサービスも数か月単位で機能が変わるため、社内で案内する際は確認した日付を添えて共有してみてください。
マルチモーダルAIの活用事例
活用が進んでいる分野は、複数のセンサーや記録を同時に見る必要がある現場です。分野ごとの使われ方を一般的な形で紹介したうえで、事務の仕事での使い方を取り上げます。
自動運転|カメラやセンサーの情報を合わせて周りを判断する
自動運転では、カメラの映像、周りとの距離を測るセンサーの値、地図の情報を合わせて、歩行者や信号、周りの車の動きを判断します。1つのセンサーが雨や逆光で見えにくくなっても、別の情報で補えることが、複数の種類を扱う利点となります。産総研マガジンでも、防犯カメラと並んで自動運転がマルチモーダルAIの応用例に挙がります。
医療|画像と検査値・問診を合わせた診断支援
医療では、レントゲンなどの画像と、検査値や問診の記録を組み合わせて、医師の診断を支える使い方が研究されています。診断を下すのは医師で、AIはその判断を支える補助にあたります。
製造|画像と音・振動で異常を見つける品質管理
製造の現場では、製品の外観を撮った画像に、機械の音や振動のデータを加えて、不良品や故障の兆しを見つける使い方があります。見た目では分からない異常を音で拾えるため、1種類のデータだけで見るよりも見逃しを減らしやすくなります。工場や建設などの現場での使われ方は、マルチモーダルAIが変える現場作業でも取り上げました。
防犯・監視カメラ|映像と音声を合わせて見る
防犯の分野では、カメラの映像に加えて、ガラスの割れる音や叫び声といった音声も手がかりにして、異常な出来事を見分ける使い方が検討されています。映像だけでは分かりにくい死角の出来事も、音から気づけることがあります。
小売|接客とレコメンド
小売では、売り場のカメラ映像や購買の記録、問い合わせの文章を合わせて、お客様一人ひとりに合う商品を案内する使い方が考えられています。声で質問を受けて、商品の写真を見せながら答える案内係のような使い方も出来ます。
事務での使い方|画像の文字読み取り・手書き図・会議音声・長い資料
社員10〜200名の会社で身近なのは、チャット画面に写真やファイルを入れて頼む使い方でしょう。紙の申請書を撮影して表に起こす、ホワイトボードの写真から議事メモを作る、手書きの図を清書する、会議の録音を文字に起こして要約する、長いPDFの規程集から必要な箇所を探す、といった作業が代表例になります。最初に試しやすい使い方と、試す前に見ておきたい点を1行ずつ組にしてみました。
- ホワイトボードの写真から議事メモを作る(試す前に、端に写った別の書き込みや人の顔を切り取る)
- 紙の申請書をExcelに起こす(氏名・住所などの個人情報が入っていないかを見る)
- エラー画面のスクリーンショットで原因を調べる(顧客名や社内のURLが写っていないかを見る)
- 商品写真から説明文を作る(他社の写真や素材を使っていないかを見る)
- PDFの規程集を要約する(社外秘の区分に当たらないかを見る)
どれも手軽な使い方ですが、入れた写真や書類はそのままAIの提供元に送られる点は変わりません。
マルチモーダルAIのメリット|判断の精度・複雑な作業・業務効率・顧客体験
メリットは、人が目と耳で集めていた情報を、AIがまとめて受け取れるようになる点にあります。1つ目は判断の精度で、画像と数値など複数の手がかりを突き合わせることで、1種類だけでは気づけない異常や関係を拾いやすくなります。2つ目は複雑な作業を任せられることで、図の入った資料を読んで要点を文章にまとめる、といった複数の手順を1回の依頼で頼めます。3つ目は業務効率で、紙や画像を手で打ち直す手間や、録音を聞き直す時間を減らすことが出来ます。4つ目は顧客体験で、声や写真で問い合わせを受け付けられれば、文章で説明しにくいお客様の困りごとにも応えやすくなります。ただし、渡せる情報が増えるほど、うっかり渡してしまう情報も増える点は覚えておきましょう。
マルチモーダルAIの課題
課題は、作る側の負担と、使う側の注意の両方にあります。
データ量と計算負荷・コスト
複数の種類の情報を学ばせるには、文字だけの場合よりも大量のデータと計算の設備が必要になります。画像や動画はデータが大きく、処理に時間と費用がかかりやすいことも、開発する側の負担となってしまいます。チャットで使う側にとっても、動画や長い音声は上限に達しやすく、Geminiのように長さの上限がプランで変わるサービスもあります。
判断の根拠が分かりにくい(ブラックボックスと説明可能なAI)
複数の情報を内部で混ぜて判断するため、どの情報が決め手になったのかを人が追いかけにくい点が課題として挙げられます。中身が見えないこの状態はブラックボックスと呼ばれ、判断の理由を示せるようにする説明可能なAI(XAI)の研究が進められています。
出力の誤りと人による確認(ハルシネーション)
AIは、画像や音声を読み違えたまま、もっともらしい答えを返すことがあります。事実と違う内容をそれらしく出力するこの現象はハルシネーションと呼ばれ、文字だけのやりとりと同じく、人が確認する工程が欠かせません。OpenAIの画像入力のヘルプでも、回転した画像を読み違えることや、写っている物の数が概算になることが制限として挙げられています。AIが読み取った数字や固有名詞は、元の写真や書類と突き合わせてから使いましょう。
情報漏えい・セキュリティ
写真や録音には、打ち込んだ文章よりも多くの情報が含まれるため、入れるつもりのなかった情報まで渡ってしまうことがあります。どの情報がどこまで伝わるのかは、この後の節で具体的に扱います。
著作権などの権利侵害
他人が撮った写真や他社の資料の図を入れて加工する使い方や、生成した画像を社外に出す使い方では、著作権などの権利に触れるおそれがあります。実在の人物の顔や声に似せた画像・音声を作る使い方も、本人の権利や信用を傷つけるおそれがあるため、社内で禁止する項目に入れておくと安心です。細かな判断は個別の事情で変わるため、社外に出す前に担当者が確認する流れを決めておきましょう。
マルチモーダルAIの今後|AIエージェント・フィジカルAI・より自然な対話
今後は、AIが見て聞いたうえで、自分から作業を進める方向へ広がっていくと考えられます。画面を見ながら人に代わって操作を進めるAIエージェントや、ロボットのように現実の世界で体を動かすフィジカルAIは、どちらも目と耳にあたる情報をまとめて扱えることが前提となります。声で話しかけて、写真を見せながら相談するような、人どうしに近い自然な対話も広がりつつあります。Claudeの音声モードは、すべてのプランで使えるベータ機能として案内されており、英語以外の言語への対応もベータとされています。使える場面が増えるほど、社員が画像や音声をAIに渡す機会も増えていくことになります。
画像・音声・PDFをAIに渡すと、何がどこまで伝わるのか
画像や音声で渡した情報も、文字で打ち込んだ情報と同じく、AIの提供元に送られて読み取られます。
画像にすれば大丈夫、は誤解
社外秘の文章を画像にしたり、紙をスキャンしたPDFにしたりすれば安全、というわけではありません。写真やスクリーンショットの中の文字は、AIが読み取ることが出来ます。AIに渡す情報としては、文章を貼り付けた場合と同じ扱いになると考えてください。
PDFの中の図やグラフは、読まれないことがある
反対に、渡したつもりの情報が読まれていないこともあります。ChatGPTの公式ヘルプでは、PDFのビジュアル検索に対応しているのはChatGPT Enterpriseで、ほかのプランではファイルから文字を取り出し、画像は破棄すると書かれています。Claudeは、100ページ以下のPDFなら文字と図やグラフの両方を読み、101〜1000ページのPDFでは文字だけを処理する仕様です。グラフの読み取りを頼むときは、図の部分を画像として切り出して渡すと、読み落としを避けやすくなります。
日本語の文字が写った画像は、読み違えに注意
OpenAIの画像入力のヘルプには、日本語や韓国語などラテン文字以外の文字を含む画像では性能が下がる、と制限として書かれています。手書きの申請書や日本語の画面を読ませたときは、氏名や金額、日付を元の画像と見比べてみてください。
動画は、映像の中身まで読まれるとは限らない
Perplexityの公式ヘルプでは、動画の話し声は自動で文字に起こされる一方、映像の場面は今のところ索引化されず、検索の対象にならないと説明されています。ChatGPTも動画ファイルを添付できますが、分析が不完全になったり、音声を正確に解釈できなかったりする場合があると案内されており、動画の要約は元の映像で確かめる前提で使うのが無難です。
写真の位置情報は、モデルが読まなくても残ったまま送られることがある
スマートフォンで撮った写真には、見た目の画像のほかに、撮影日時や機種、撮影した場所の位置情報が含まれていることがあります。IPA(情報処理推進機構)の資料では、写真はExif(イグジフ)という形式で保存され、撮影日時や撮影機器のモデル名、カメラの設定、位置情報(GPS情報)などが付け加えられていると説明されています。OpenAIの画像入力のヘルプには、モデルは元のファイル名やメタデータを処理しない、という記載があります。ただし、これはモデルが読まないという意味で、位置情報などが残ったままのファイルが提供元に送られる場合がある点は変わりません。ChatGPTのファイルアップロードFAQでは、ファイルはチャットが残っている間アカウントに保存され、チャットを削除すると30日以内に削除されると案内されており、例外も設けられています。事務所や顧客先で撮った写真なら、位置情報から場所が分かってしまうため、渡す前に外しておくのが安全です。
社員が思い思いのAIに録音や資料を入れる状態から、会社で管理できる1つの環境にまとめる方法があります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。
スクリーンショットを渡す前の映り込みチェック
スクリーンショットは画面の全部を写すため、質問に関係のない情報まで一緒に渡しやすい素材になります。渡す前に、次の項目が写っていないかを確かめてみてください。
- 通知のポップアップチャットやメールの通知に、差出人の名前や本文の一部が出ていないか。
- ブラウザのタブ名とブックマーク開いている他のページの題名や、社内システムの名前が並んでいないか。
- 背後の別ウィンドウ質問と関係のない資料や表が、後ろに見えていないか。
- 顧客名と金額会計ソフトや販売管理の画面に、取引先の名前や金額が出ていないか。
- メールの宛先と署名宛先・CC欄のメールアドレスや、署名の電話番号が入っていないか。
- 社内のURLとファイル名アドレスバーの社内URLや、デスクトップのファイル名から中身が推測されないか。
- 人の顔と名札写真やWeb会議の画面に、社員やお客様の顔・名前が写っていないか。
写っていた場合は、必要な範囲だけを切り取るか、塗りつぶしてから渡しましょう。パソコンやスマートフォンに付いている画面の切り取り機能や、写真の切り抜き機能で範囲を絞ることが出来ます。塗りつぶしは、下の文字が透けて読めない色と濃さになっているかを、拡大して確かめてみてください。
写真の位置情報(Exif)を外してから渡す
現場や顧客先で撮った写真を渡すときは、位置情報を外してから入れる手順を決めておきましょう。IPAの資料によれば、よく利用されているSNSなどでは、写真をアップロードする際にExifの付加情報をサービス側で削除していますが、これはサービス側の仕組みに依存している状態とされています。同じ資料が示すとおり、Exif情報は自分で削除することも出来ます。AIのサービスが受け取った写真の付加情報をどう扱うかは、公式に書かれていない部分も多いため、送る側で外しておくと安心です。
- カメラの設定で、撮影時に位置情報を記録しないようにする
- 写真を共有するときに、位置情報を含めない設定を選ぶ
- Windowsでは、ファイルのプロパティを開き、撮影場所などの付加情報を削除する
- スマートフォンでは、Exifを削除するアプリを使う(IPAの資料で挙げられている方法)
操作の場所は機種やOSの版で変わるため、社内で使っている端末で一度試し、手順を画面の写真つきで残してみてください。
会議の録音をAIに入れる前に決めること
会議の録音は、話した内容だけでなく、参加者の声や名前、雑談まで丸ごと残る素材になります。Perplexityのように、話し声を文字に起こして話者を区別する機能を持つサービスもあり、誰が何を言ったかまでAIに渡る前提で扱う必要があります。入れる前に、次の4点を社内で決めてみてください。
- 参加者への告知:録音してAIで文字起こしや要約をすることを、会議の始めに伝えるか
- 社外の参加者がいる会議:顧客や取引先が参加する会議を対象に含めるか、相手の了承をどう取るか
- 保存と削除:録音ファイルと文字起こしの結果をどこに保存し、いつ削除するか
- 共有の範囲:要約や文字起こしの結果を、誰まで見られるようにするか
法律上の扱いは会議の内容や相手との関係で変わるため、ここでは会社として決めておく項目として挙げています。社外の方が参加する会議は、了承を得られた場合だけ録音をAIに入れる、と線を引くと迷いにくくなります。ChatGPTでは、ファイルを含むチャットを削除すると、関連するファイルは30日以内にシステムから削除されると案内されていますが、セキュリティ上や法的な理由で保存が必要な場合などは例外とされています。保存期間を決めるときは、使っているサービス側の削除の扱いも合わせて確かめておきましょう。
個人情報保護委員会の注意喚起を、画像・音声に当てはめる
画像や音声に個人の顔・声・名前が入っているなら、個人情報保護委員会が示した注意点がそのまま当てはまります。同委員会は令和5年6月2日に「生成AIサービスの利用に関する注意喚起等」を公表し、個人情報を扱う事業者に向けた注意点を示しています。
個人情報保護委員会「生成AIサービスの利用に関する注意喚起等」(令和5年6月2日)の(1)②の原文:(前略)あらかじめ本人の同意を得ることなく生成AIサービスに個人データを含むプロンプトを入力し、当該個人データが当該プロンプトに対する応答結果の出力以外の目的で取り扱われる場合、当該個人情報取扱事業者は個人情報保護法の規定に違反することとなる可能性がある。そのため、このようなプロンプトの入力を行う場合には、当該生成AIサービスを提供する事業者が、当該個人データを機械学習に利用しないこと等を十分に確認すること。
この②を画像と音声の場面に置き換えると、社員の顔写真、お客様が写った写真、名前の入った書類の画像、会議の録音は、どれも個人データを含むプロンプトになりえます。本人の同意を得ずにこうしたファイルを入れる場合は、提供元がそのデータを機械学習に使わないこと等を確認するよう、この注意喚起で求められています。OpenAIの公式ヘルプには、APIやChatGPT Enterpriseなどのビジネス向けサービスに送られた内容をモデルの性能向上に使わない、という記載があります。社員が個人の無料アカウントで入れた場合、この確認を会社で行うのは難しくなります。個人アカウントの設定は本人任せになり、誰が何を入れたかも会社からは見えないためです。こうした見えない利用は野良AI(シャドーAI)と呼ばれており、見つけ方と対策は別の記事にまとめています。
社内ルールに足す「画像・音声・PDF」の条文例
すでに生成AIの社内ルールがある会社でも、文字の入力を前提に書かれていて、画像や録音の扱いが抜けていることがあります。次のひな形を、自社の言葉に直して足してみてください。
- (入れてよい場所)業務の画像・音声・PDFは、会社が契約したAIの環境にだけ入れることが出来る。
- (入れないもの)マイナンバーが写った書類、本人確認書類、健康に関する情報が写った書類、顧客から預かった社外秘の資料は入れない。
- (入れる前の加工)スクリーンショットと写真は必要な範囲だけに切り取り、顧客名・金額・通知などの写り込みを塗りつぶす。写真は位置情報(Exif)を外してから入れる。
- (録音)会議の録音を入れるときは、会議の始めに参加者へ伝える。社外の参加者がいる会議は、相手の了承を得た場合に限る。
- (保存と削除)録音と文字起こしの結果は会社が決めた場所に保存し、定めた期間が過ぎたら削除する。
- (読み取り結果の確認)AIが画像や音声から読み取った数字・氏名・日付は、元のファイルと照らし合わせてから使う。
- (生成物の社外利用)AIで作った画像や、他人の写真・資料を加工したものを社外に出すときは、担当者の確認を受ける。実在の人物の顔や声に似せた画像・音声は作らない。
ルール全体の作り方は生成AIの社内ガイドラインの作り方で、点検の項目は生成AIのセキュリティ対策チェックリストで扱っています。
会社として使う画面を1つに決める
条文を決めても、社員が個人のアカウントで入れてしまえば、会社からは守られているかを確かめられません。写真や録音はスマートフォンから手軽に入れられる分、文字よりも個人アカウントに流れやすい素材でしょう。会社で使う環境を1つに決め、その環境で入力が学習に使われない設定になっているか、誰が何を入れたかの記録を会社で見られるかを確かめておきましょう。法人向けプランの違いはChatGPTの法人プランと料金で整理しており、用途ごとにAIを選び分けたい場合は、複数のAIを1つの環境で使う形も選択肢になります。
録音・資料を、会社の管理下で4つのAIに
UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1契約で使える法人向けサービスです。会議録音や動画も読み込める音声・動画入力、画像・PDF生成、自社資料を読み込ませて回答する社内文書RAGに対応し、管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを管理できます。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。
UPGEAR AIの詳細を見るよくある質問
マルチモーダルAIとは何ですか?
シングルモーダルAIとの違いは何ですか?
マルチモーダルAIとマルチAIは同じものですか?
ChatGPTにPDFを渡せば、中の図やグラフも読んでくれますか?
写真をAIに入れると、位置情報も送られますか?
会議の録音をAIで要約してもよいですか?
まとめ
マルチモーダルAIは、文字・画像・音声・動画といった種類の違う情報をまとめて扱うAIで、主な対話型AIもこの性質を備えています。仕組みの面では、情報を数値に直して統合し、一緒に現れる関係から学ぶことで、1種類だけでは分からない関係を読み取れるようになりました。会社で使う場面では、渡した写真や録音の中身が、打ち込んだ文章以上にAIへ伝わってしまいます。スクリーンショットの映り込み、写真の位置情報、録音の告知、使う環境を1つに決めることの4点から、社内のルールを見直してみてください。ほかの用語はAI活用コラム一覧から探すことが出来ます。
