2026-08-23
中国DeepSeek、実験的マルチモーダルモデルで「視覚」を搭載 画像・動画理解に本格参入へ
中国発の大規模言語モデル(LLM)メーカーDeepSeekが、テキストだけでなく画像も扱える実験的なマルチモーダルAIモデルを公開したと、中国メディアが報じています。マルチモーダルとは、文章・画像・音声など複数のデータ形式を同時に処理できるAIのことで、米OpenAIの「GPT‑4o」などと同じ方向性の技術です。
報道によれば、新モデルはまず研究者や一部パートナー企業向けに限定公開され、物体認識や画像キャプション生成、シンプルな図表の読み取りといったタスクで性能検証が進められています。DeepSeekはコスト性能の高いオープン寄りモデルで注目を集めてきましたが、これまで主力はテキスト特化型でした。
今回の取り組みは、中国企業がマルチモーダル分野でも欧米勢に追いつきつつあることを示す動きといえます。画像や動画理解は、監視カメラ解析や自動運転、製造現場の異常検知など実用ニーズが大きく、規制面の議論も避けられません。中国ではすでに生成AIサービスの登録制やコンテンツ規制が始まっており、今後この新モデルがどのような制約のもとで商用展開されるのかが注目されます。
元記事: DeepSeek Enters the Multimodal AI Race With Experimental Vision Model