画像認識、コンピュータビジョン、画像処理に関連する記事へのリンク集

画像認識、コンピュータビジョン、画像処理に関連する記事へのリンク集

3035 bookmarks
Custom sorting
動画生成AI「MiniMax H3」の開発チームが「画像生成・編集モデル」「動画アップスケールモデル」「低ステップ版MiniMax H3」を準備中であることを明言
動画生成AI「MiniMax H3」の開発チームが「画像生成・編集モデル」「動画アップスケールモデル」「低ステップ版MiniMax H3」を準備中であることを明言
オープンモデルとして公開されている動画生成AI「MiniMax H3」の開発チームがオンライン掲示板のRedditでAMA(Ask Me Anything:何でも聞いて企画)を実施し、今後も各種AIモデルを公開予定であることを明言しました。
·gigazine.net·
動画生成AI「MiniMax H3」の開発チームが「画像生成・編集モデル」「動画アップスケールモデル」「低ステップ版MiniMax H3」を準備中であることを明言
Grokの画像生成AIが「Imagine Image 2.0」にアップデートされたので使ってみた、実写風もイラスト風も対応し文字も描写可能
Grokの画像生成AIが「Imagine Image 2.0」にアップデートされたので使ってみた、実写風もイラスト風も対応し文字も描写可能
SpaceXAIが画像生成AI「Imagine Image 2.0」を2026年8月7日にリリースしました。Grokの無料ユーザーでも実行可能だったので、実際に複数の画像を生成して性能を確かめてみました。
·gigazine.net·
Grokの画像生成AIが「Imagine Image 2.0」にアップデートされたので使ってみた、実写風もイラスト風も対応し文字も描写可能
Googleが手話をテキストに変換するAIモデルをPixel 11に搭載
Googleが手話をテキストに変換するAIモデルをPixel 11に搭載
Google DeepMindの手話チームが、手話の映像を文字に変換する「多言語手話・テキスト変換(sign-language-to-text:SL2T)翻訳モデル」を発表しました。2026年8月20日発売のPixel 11で、手話で文字を入力できるようになる予定です。
·gigazine.net·
Googleが手話をテキストに変換するAIモデルをPixel 11に搭載
スマホで動く視覚言語モデル「LFM2.5-VL-3B」が登場、日本語対応でUI認識やOCRに活用できる
スマホで動く視覚言語モデル「LFM2.5-VL-3B」が登場、日本語対応でUI認識やOCRに活用できる
アメリカに拠点を置くAI企業のLiquid AIが視覚言語モデル「LFM2.5-VL-3B」を発表しました。LFM2.5-VL-3Bはスマートフォンでも動作することが確認されている軽量VLMで、文書のOCRやUIの認識などが可能。オープンモデルとして公開されており、無償でダウンロード可能です。
·gigazine.net·
スマホで動く視覚言語モデル「LFM2.5-VL-3B」が登場、日本語対応でUI認識やOCRに活用できる
監視カメラメーカーのFlockが不正利用対策を表明、データ保存期間を30日間から7日間に短縮し目的別フィルタリング機能も追加
監視カメラメーカーのFlockが不正利用対策を表明、データ保存期間を30日間から7日間に短縮し目的別フィルタリング機能も追加
アメリカ全土にナンバープレート追跡用の監視カメラネットワークを構築しているFlock Safety(Flock)が、「監視カメラ映像が警察官によるストーキングに悪用されていた」などのスキャンダルを受けて、不正利用を防ぐための対策を表明しました。
·gigazine.net·
監視カメラメーカーのFlockが不正利用対策を表明、データ保存期間を30日間から7日間に短縮し目的別フィルタリング機能も追加
画像生成AIを開発するMidjourneyが係争中のハリウッドの映画スタジオに対してAIの利用状況の詳細を明らかにするよう要求
画像生成AIを開発するMidjourneyが係争中のハリウッドの映画スタジオに対してAIの利用状況の詳細を明らかにするよう要求
画像生成AIを開発するMidjourneyがディズニー、ユニバーサル、ワーナーブラザース・ディスカバリー(WBD)の大手映画スタジオ3社との著作権訴訟において、スタジオ側のAI利用実態を開示するよう求めています。両者の対立は開示手続きの範囲を巡るものに移っており、担当判事は消費者向けの映像や画像に関する情報のみ開示対象とする判断を示していましたが、Midjourneyはこの制限の撤回を求める申立てを行いました。
·gigazine.net·
画像生成AIを開発するMidjourneyが係争中のハリウッドの映画スタジオに対してAIの利用状況の詳細を明らかにするよう要求
MetaがGIFアニメも作れる画像生成AI「Muse Image」をリリース&音声付き動画を生成できる「Muse Video」も発表される
MetaがGIFアニメも作れる画像生成AI「Muse Image」をリリース&音声付き動画を生成できる「Muse Video」も発表される
現地時間の2026年7月7日、Metaが画像生成AI「Muse Image」と動画生成AI「Muse Video」を発表しました。Muse Imageはすでにサービスが展開されていて、Muse Videoは近日中にサービス開始予定です。
·gigazine.net·
MetaがGIFアニメも作れる画像生成AI「Muse Image」をリリース&音声付き動画を生成できる「Muse Video」も発表される
AIへの画像入力は解像度を下げると逆にコストが増えることがあるという実験結果
AIへの画像入力は解像度を下げると逆にコストが増えることがあるという実験結果
AIモデルの中には画像認識に対応したものが多くあります。AIに画像を認識させるワークフローのコスト削減策として「入力画像の解像度を低くする」というアイデアが広がっているのですが、AIのAPI提供サービスを展開するOpenRouterが「解像度を低くすると逆にコストが増大する」という実験結果を報告しています。
·gigazine.net·
AIへの画像入力は解像度を下げると逆にコストが増えることがあるという実験結果
AI時代において「CAPTCHA」に意味はあるのか?
AI時代において「CAPTCHA」に意味はあるのか?
ウェブサイトのログインやフォーム入力時には画像の中から特定の物体を選ぶもの、「私はロボットではありません」というチェックボックスをクリックするもの、パズルのピースを正しい位置に合わせるものなどさまざまな認証テストが使われています。こうした認証テストは「CAPTCHA」と呼ばれ人間とボットを見分けるために使われてきましたが、AIの進歩によって有効性が疑問視されていると科学系メディアのLive Scienceが解説しています。
·gigazine.net·
AI時代において「CAPTCHA」に意味はあるのか?
動画生成AI「LTX-2.3」の開発チームがAI企業「LTX」として独立、仮想世界シミュレーションを可能とする世界モデルを開発中でオープンモデルの姿勢は維持
動画生成AI「LTX-2.3」の開発チームがAI企業「LTX」として独立、仮想世界シミュレーションを可能とする世界モデルを開発中でオープンモデルの姿勢は維持
動画生成AI「LTX-2」や「LTX-2.3」の開発チームがAI企業「LTX」として独立することを発表しました。LTXは仮想世界を構築して物理現象などのシミュレーションを可能とする世界モデルの研究に取り組んでおり、今後も自社製AIモデルをオープンモデルとして公開し続ける姿勢を示しています。
·gigazine.net·
動画生成AI「LTX-2.3」の開発チームがAI企業「LTX」として独立、仮想世界シミュレーションを可能とする世界モデルを開発中でオープンモデルの姿勢は維持
Mistral AIがロボット用ナビゲーションAI「Robostral Navigate」を発表、「ロッカーの手前で右折して」といった自然言語での指示に対応可能
Mistral AIがロボット用ナビゲーションAI「Robostral Navigate」を発表、「ロッカーの手前で右折して」といった自然言語での指示に対応可能
フランスのAI企業であるMistral AIがロボット自動ナビゲーションAIモデル「Robostral Navigate」を発表しました。Robostral Navigateをロボットに導入することで「ロッカーの手前で右に曲がってオレンジ色のソファまで直進して」といったように自然言語での移動指示が可能となります。
·gigazine.net·
Mistral AIがロボット用ナビゲーションAI「Robostral Navigate」を発表、「ロッカーの手前で右折して」といった自然言語での指示に対応可能
「AI児童ポルノを作成・拡散している可能性」についてスペイン首相がX・Meta・TikTokに対する捜査を要請
「AI児童ポルノを作成・拡散している可能性」についてスペイン首相がX・Meta・TikTokに対する捜査を要請
スペインのペドロ・サンチェス首相が検察庁に対し、X、Meta、TikTokを対象として「AIを通じて児童ポルノを作成・拡散している可能性」について捜査を行うよう要請しました。
·gigazine.net·
「AI児童ポルノを作成・拡散している可能性」についてスペイン首相がX・Meta・TikTokに対する捜査を要請
世界最大級の映画館チェーンがAI短編映画の上映を拒否
世界最大級の映画館チェーンがAI短編映画の上映を拒否
全世界で898の映画館と1万超のスクリーンを運営する世界最大級の映画館チェーンであるAMCシアターズが、AI生成の短編映画である「Thanksgiving Day」の上映を取り止めると発表しました。
·gigazine.net·
世界最大級の映画館チェーンがAI短編映画の上映を拒否
無料でYouTubeなどから動画や音楽をダウンロード・保存できるオープンソースAndroidアプリ「Seal」
無料でYouTubeなどから動画や音楽をダウンロード・保存できるオープンソースAndroidアプリ「Seal」
YouTubeなどのサイトから動画をダウンロードする場合yt-dlpを利用するのが有力な手段の候補となります。ただしyt-dlpはCUIツールであるため高機能を活かすには膨大なコマンドラインオプションを把握する必要があり万人向けとはいいがたく、特にスマートフォンで気軽に使用するのには不向きである点は否めません。そんなyt-dlpの機能をAndroidで気軽に使えるようにするアプリが「Seal」です。
·gigazine.net·
無料でYouTubeなどから動画や音楽をダウンロード・保存できるオープンソースAndroidアプリ「Seal」
無料でテクスチャ素材を生成できる「TextureCreate」
無料でテクスチャ素材を生成できる「TextureCreate」
アプリやゲームに使えるUIデザインなどを発信する「ゲームUI演出」が公開した「TextureCreate」は、無料でブラウザから使用できるテクスチャジェネレータです。素材を選択して調整するだけで簡単にテクスチャ素材を作成できるとのことなので、実際に使ってみました。
·gigazine.net·
無料でテクスチャ素材を生成できる「TextureCreate」
YouTubeが「政治家になりすましたAIフェイク動画」の検出ツールを提供開始
YouTubeが「政治家になりすましたAIフェイク動画」の検出ツールを提供開始
YouTubeはAIによるフェイク動画の対策として、「自分と似た顔が使われている動画を検出する機能」をYouTubeパートナープログラムに参加するクリエイターに提供しています。新たに、類似動画検出機能を政治家やジャーナリストにも提供することが2026年3月10日に発表されました。
·gigazine.net·
YouTubeが「政治家になりすましたAIフェイク動画」の検出ツールを提供開始
無料でアップロードした画像や動画を意図的に劣化させガビガビにするツール「GABIBI(ガビビ)」
無料でアップロードした画像や動画を意図的に劣化させガビガビにするツール「GABIBI(ガビビ)」
デザイナーであるトミナガハルキさんが、画像を意図的に劣化させてノイズだらけにする無料のウェブツール「GABIBI(ガビビ)」を公開しました。美麗な写真をあえて90年代~00年代にインターネットで見られたような低画質でノイズだらけのJPEG画像に加工することができます。
·gigazine.net·
無料でアップロードした画像や動画を意図的に劣化させガビガビにするツール「GABIBI(ガビビ)」
ありとあらゆるAIモデルを組み合わせることができる「LibreChat」で「ウェブ検索」「画像自動生成」をやってみる、無料でセルフホスト可能
ありとあらゆるAIモデルを組み合わせることができる「LibreChat」で「ウェブ検索」「画像自動生成」をやってみる、無料でセルフホスト可能
ChatGPTやClaude、GeminiなどのAIチャットサービスは便利ですが、それぞれのサービスを行き来する手間がかかります。無料でセルフホスト可能な「LibreChat」は、ありとあらゆるAIモデルをひとつの画面でまとめて扱える統合プラットフォームです。今回はLibreChatの機能のうち「ウェブ検索」と「画像生成」を試してみました。
·gigazine.net·
ありとあらゆるAIモデルを組み合わせることができる「LibreChat」で「ウェブ検索」「画像自動生成」をやってみる、無料でセルフホスト可能
EUは職員がAI生成画像を使うことを禁止している、AI生成コンテンツを投稿しまくるアメリカのトランプ大統領とは対照的
EUは職員がAI生成画像を使うことを禁止している、AI生成コンテンツを投稿しまくるアメリカのトランプ大統領とは対照的
欧州連合(EU)の主要組織である欧州委員会・欧州議会・欧州連合理事会は、職員が公式の文書や発信でAI生成画像やAI生成動画を使用することを禁止していると、ニュースメディアのPOLITICOが報じました。
·gigazine.net·
EUは職員がAI生成画像を使うことを禁止している、AI生成コンテンツを投稿しまくるアメリカのトランプ大統領とは対照的
AppleがAIトレーニングのために数百万本のYouTube動画をスクレイピングしたとして複数のYouTubeチャンネルから訴えられる
AppleがAIトレーニングのために数百万本のYouTube動画をスクレイピングしたとして複数のYouTubeチャンネルから訴えられる
Appleが自社のAIモデルをトレーニングするために、YouTubeから数百万本の動画を不正にスクレイピングしたとして、カリフォルニア州北部地区連邦地方裁判所に提訴されました。この訴訟は、Ted Entertainment、Matt Fisher、Golfholicsの3者が全米のコンテンツクリエイターを代表して提起した集団訴訟で、原告側は、AppleがYouTubeの技術的保護手段(TPM)を意図的に回避して著作権を侵害したと主張し、損害賠償と差し止めを求めています。
·gigazine.net·
AppleがAIトレーニングのために数百万本のYouTube動画をスクレイピングしたとして複数のYouTubeチャンネルから訴えられる
Netflixが新たに開発した動画編集フレームワーク「VOID」を発表、動画から任意の物体を消した場合に残りの物体の動きを物理シミュレーションして映像を生成可能
Netflixが新たに開発した動画編集フレームワーク「VOID」を発表、動画から任意の物体を消した場合に残りの物体の動きを物理シミュレーションして映像を生成可能
Netflixとブルガリア・ソフィア大学の研究チームが動画編集フレームワーク「Video Object and Interaction Deletion(VOID)」を発表しました。従来の削除手法は背景の補完や外観の修正には優れていましたが、物体同士の複雑な物理的接触が絡むシーンでは不自然な結果を招くことが多く、VOIDはこうした課題を解決するために設計されました。
·gigazine.net·
Netflixが新たに開発した動画編集フレームワーク「VOID」を発表、動画から任意の物体を消した場合に残りの物体の動きを物理シミュレーションして映像を生成可能
Xに画像モザイクツールが追加される&ポスト自動翻訳機能が日本以外でも展開開始&xAIが10兆パラメーターのAIを開発中
Xに画像モザイクツールが追加される&ポスト自動翻訳機能が日本以外でも展開開始&xAIが10兆パラメーターのAIを開発中
2026年4月8日にXの投稿機能がアップデートされ、投稿作成中に画像にモザイクを追加できるようになりました。また、アメリカや日本向けに提供されていた自動翻訳機能が全世界に向けて展開されています。
·gigazine.net·
Xに画像モザイクツールが追加される&ポスト自動翻訳機能が日本以外でも展開開始&xAIが10兆パラメーターのAIを開発中
なぜH.265(HEVC)サポートを終了するPCメーカーが登場したのか、H.265のライセンスが複雑な理由とは?
なぜH.265(HEVC)サポートを終了するPCメーカーが登場したのか、H.265のライセンスが複雑な理由とは?
動画を圧縮・解凍するコーデックにはさまざまあり、主流なものにはH.264(AVC)、H.265(HEVC)、AV1などがあります。このうち、H.265はライセンス料の問題で、一部PCメーカーがサポートを無効にする事態も起こっています。H.265のライセンス料やロイヤリティについて、IT系ニュースサイトのArs Techinicaがまとめています。
·gigazine.net·
なぜH.265(HEVC)サポートを終了するPCメーカーが登場したのか、H.265のライセンスが複雑な理由とは?
OpenAIが画像生成AI「ChatGPT Images 2.0」を正式リリースしたので使ってみた、イラストも日本語セリフも高品質に描写可能
OpenAIが画像生成AI「ChatGPT Images 2.0」を正式リリースしたので使ってみた、イラストも日本語セリフも高品質に描写可能
OpenAIがChatGPTの画像生成機能「ChatGPT Images 2.0」を日本時間の2026年4月22日に正式リリースしました。ChatGPT Images 2.0は第三者機関のテストで世界ランキングトップのスコアを記録しており、英語以外の言語の文字列描写やプロンプト追従性が大きく向上しているとのこと。ChatGPTの無料プランでも使用可能だったので実際に画像の生成・編集を試してみました。
·gigazine.net·
OpenAIが画像生成AI「ChatGPT Images 2.0」を正式リリースしたので使ってみた、イラストも日本語セリフも高品質に描写可能
気分を伝えたり自撮りを見せたりするとAIがオススメドリンクを提案してくれるChatGPTのミニアプリをスターバックスが提供
気分を伝えたり自撮りを見せたりするとAIがオススメドリンクを提案してくれるChatGPTのミニアプリをスターバックスが提供
世界最大のコーヒーチェーンであるスターバックスは、AIを使用してユーザーの気分に応じたドリンクを推奨するためのChatGPT内ミニアプリを2026年4月15日に発表しました。テキストで気分を伝えたり、現在の場所や天気を画像でアップロードしたりすることで、AIがドリンクを提案してくれます。
·gigazine.net·
気分を伝えたり自撮りを見せたりするとAIがオススメドリンクを提案してくれるChatGPTのミニアプリをスターバックスが提供
『ウォーリーをさがせ!』っぽい画像をChatGPT Images 2.0やその他の画像生成AIで作ってみた結果は?
『ウォーリーをさがせ!』っぽい画像をChatGPT Images 2.0やその他の画像生成AIで作ってみた結果は?
OpenAIは日本時間の2026年4月22日(水)、ChatGPTの画像生成機能「ChatGPT Images 2.0」を正式リリースしました。ソフトウェアエンジニアのサイモン・ウィリソン氏がChatGPT Images 2.0やその他の画像生成AIを使って、世界中で大人気の絵本シリーズ『ウォーリーをさがせ!』っぽいイラストを再現した結果を報告しています。
·gigazine.net·
『ウォーリーをさがせ!』っぽい画像をChatGPT Images 2.0やその他の画像生成AIで作ってみた結果は?
知識を文章ではなくイラストで教えてくれるAI「Flipbook」が登場、気になるところをクリックすると次々に説明イラストが生成される
知識を文章ではなくイラストで教えてくれるAI「Flipbook」が登場、気になるところをクリックすると次々に説明イラストが生成される
「Flipbook」は質問内容に関する説明付きイラスト(インフォグラフィック)を生成してくれるAIサービスです。イラスト内の気になる部分をクリックすると、その部分に関する説明イラストを生成してくれて、どんどん知識を深めることが可能。面白そうだったので使ってみました。
·gigazine.net·
知識を文章ではなくイラストで教えてくれるAI「Flipbook」が登場、気になるところをクリックすると次々に説明イラストが生成される
6秒ループ動画アプリ「Vine」が「Divine」としてアプリストアに復活、Twitter創業者ジャック・ドーシーが資金提供
6秒ループ動画アプリ「Vine」が「Divine」としてアプリストアに復活、Twitter創業者ジャック・ドーシーが資金提供
「創造力を人間の手に取りもどす」というビジョンを掲げて2025年末にベータ版が登場した6秒でループする動画を共有できるアプリ「Divine」の正式版が、App StoreとGoogle Playに登場しました。「6秒ループ動画アプリ」というコンセプトは2017年にサービスが終了した「Vine」を引き継いだもので、Twitterの創業者であるジャック・ドーシー氏による資金提供が大きな助けとなっています。
·gigazine.net·
6秒ループ動画アプリ「Vine」が「Divine」としてアプリストアに復活、Twitter創業者ジャック・ドーシーが資金提供