Gemini のマルチモーダル機能概要
Gemini は画像・動画・音声・テキストを横断して理解できるマルチモーダル AI です。スマートフォンで撮影した写真を即座に分析したり、YouTube の動画内容を要約したりできます。
マルチモーダル機能の活用手順
- gemini.google.com のチャット画面で画像アイコンをクリックし写真をアップロードする
- 「この商品の特徴を説明して」「この料理のレシピを推測して」と質問する
- 複数の画像を同時アップロードし「2枚の違いを比較して」と指示できる
- スクリーンショットを貼り付けて「このエラーの原因と解決策は?」と質問する
- YouTube URL を貼り付けて「この動画の要点をまとめて」と指示する(Gemini Advanced)
活用のコツ
- 手書きメモや図表を撮影してテキスト化・デジタル化するのに最適
- グラフ・統計表の画像から数値を読み取り分析させることができる
- プレゼンスライドの画像を貼り付けてフィードバックを依頼すると有効
- Gemini Advanced はより高精度な画像理解と動画長時間分析に対応している