画像認識、コンピュータビジョン、画像処理に関連する記事へのリンク集

画像認識、コンピュータビジョン、画像処理に関連する記事へのリンク集

3035 bookmarks
Custom sorting
左右対称で典型的な「AIっぽいきれいな顔」は買い物客を遠ざけてしまう可能性
左右対称で典型的な「AIっぽいきれいな顔」は買い物客を遠ざけてしまう可能性
中国ではインターネットのライブ配信を通じて商品を売り込むライブコマース市場が成熟しており、中にはAIで生成された「AIストリーマー(AI司会者)」によるライブコマースもあります。そんなAI司会者の「顔の魅力」が配信を視聴するユーザーに与える影響について調べた研究結果を、中国の研究チームが発表しました。
·gigazine.net·
左右対称で典型的な「AIっぽいきれいな顔」は買い物客を遠ざけてしまう可能性
無料でオープンソースの写真撮影ワークフローアプリ「darktable」、RAW現像も可能
無料でオープンソースの写真撮影ワークフローアプリ「darktable」、RAW現像も可能
写真の選別やRAW現像、部分的な色補正からJPEGへの書き出しまでをまとめて行え、被写体を自動選択するAIマスクやAIノイズ除去もPC内で処理できる無料でオープンソースの写真ワークフローアプリ「darktable」が公開されています。
·gigazine.net·
無料でオープンソースの写真撮影ワークフローアプリ「darktable」、RAW現像も可能
Appleの「カメラ搭載AirPods」がリリース間近らしいことがmacOSリリース候補版内のファイルから判明
Appleの「カメラ搭載AirPods」がリリース間近らしいことがmacOSリリース候補版内のファイルから判明
Appleが配信したmacOS Tahoe 26.7のリリース候補版に含まれたファイルから、多数の未発表製品の存在が明らかになりました。ファイルの情報から、Appleは「カメラ搭載のAirPods」を開発していて、まもなくリリース予定だとみられています。
·gigazine.net·
Appleの「カメラ搭載AirPods」がリリース間近らしいことがmacOSリリース候補版内のファイルから判明
AIヌード化アプリがInstagramやFacebookの広告で宣伝されていたことが判明、Appleの審査を掻い潜り公式ストアで配信されていた
AIヌード化アプリがInstagramやFacebookの広告で宣伝されていたことが判明、Appleの審査を掻い潜り公式ストアで配信されていた
FacebookやInstagramといったSNSを展開するMetaは、自社プラットフォームで横断的に広告を配信できるMeta広告という広告サービスを展開しています。このMeta広告で広告が掲出されたAIヌード化アプリの「Kromix」を、AppleがApp Storeから削除したことが明らかになりました。
·gigazine.net·
AIヌード化アプリがInstagramやFacebookの広告で宣伝されていたことが判明、Appleの審査を掻い潜り公式ストアで配信されていた
無料で多種多彩なビジョンAIモデルを試用・比較・評価できる「Roboflow Playground」
無料で多種多彩なビジョンAIモデルを試用・比較・評価できる「Roboflow Playground」
ゼロショットコンピュータビジョンモデルとは事前の追加学習やアノテーションデータなしで訓練時に見たことのない 新しいオブジェクトやクラスを認識・検出できるAIモデルです。ゼロショットコンピュータビジョンモデルを比較検討するには最新モデルの調査・クラウドAPIを呼び出すコードの記述・オープンウェイトモデル用インフラ整備といった時間のかかる作業が不可欠であり、下手をすると結果が出るまでに新しいモデルが登場していることすらありえます。「Roboflow Playground」は記事作成時点で130種類以上の人気かつ最先端のビジョンAIモデルを簡単に試用・比較・評価できるツールです。
·gigazine.net·
無料で多種多彩なビジョンAIモデルを試用・比較・評価できる「Roboflow Playground」
画像がAI生成かどうかを判別して出どころを調べるGoogleのAIツール「Backstory」はメディアのファクトチェックを迅速化している
画像がAI生成かどうかを判別して出どころを調べるGoogleのAIツール「Backstory」はメディアのファクトチェックを迅速化している
Google DeepMindは2025年、画像とテキストによる説明文を与えると画像がAI生成かどうかを判別し、これまでにどのような文脈で使われた画像なのかを調べるAIツール「Backstory」を発表しました。このBackstoryがメディアのファクトチェックを迅速化していると、ハーバード大学のジャーナリズム機関であるNieman Journalism Labが報じています。
·gigazine.net·
画像がAI生成かどうかを判別して出どころを調べるGoogleのAIツール「Backstory」はメディアのファクトチェックを迅速化している
動画生成AI「Wan3.0」が正式リリースされる、最大30秒生成可能で「製品企画スライドを読み込ませてPV作成」など情報分析精度が大幅に向上
動画生成AI「Wan3.0」が正式リリースされる、最大30秒生成可能で「製品企画スライドを読み込ませてPV作成」など情報分析精度が大幅に向上
AlibabaがAI動画生成モデル「Wan3.0」の一般提供を8月24日に開始しました。Wan3.0は文章や画像に加えて文書・スプレッドシート・スライド・ウェブページなども読み込み可能で、1回の生成で最大30秒の動画を作成できます。
·gigazine.net·
動画生成AI「Wan3.0」が正式リリースされる、最大30秒生成可能で「製品企画スライドを読み込ませてPV作成」など情報分析精度が大幅に向上
大量に存在する画像生成AIを同じプロンプトで比較できる「Image benchmarks」をOpenRouterが公開
大量に存在する画像生成AIを同じプロンプトで比較できる「Image benchmarks」をOpenRouterが公開
GoogleやOpenAIなど数多くのAI企業が画像生成AIをリリースしていますが、画像生成AIの性能は「プロンプトに対する忠実度」「テキスト描画の精度」「画像編集の正確さ」など多様な要素が絡んでおり、用途によって適切なAIは変化します。OpenRouterが公開している「Image benchmarks」では各種画像生成AIに同じプロンプトを入力した結果を一覧表示可能で、目的に合ったAIを見つけることができます。
·gigazine.net·
大量に存在する画像生成AIを同じプロンプトで比較できる「Image benchmarks」をOpenRouterが公開
Googleが動画生成AI「Gemini Omni 1.1 Flash」をリリース、「最大4Kアップスケール」「動画の続きを生成」「低解像度で高速プレビュー」など
Googleが動画生成AI「Gemini Omni 1.1 Flash」をリリース、「最大4Kアップスケール」「動画の続きを生成」「低解像度で高速プレビュー」など
Googleが動画生成AI「Gemini Omni 1.1 Flash」を現地時間の2026年8月27日にリリースしました。
·gigazine.net·
Googleが動画生成AI「Gemini Omni 1.1 Flash」をリリース、「最大4Kアップスケール」「動画の続きを生成」「低解像度で高速プレビュー」など
XやDiscordなどでGIF検索に使われてきた「Tenor」のAPI提供が終了
XやDiscordなどでGIF検索に使われてきた「Tenor」のAPI提供が終了
GIF検索サービス「Tenor」のAPI提供が2026年6月30日をもって終了しました。Tenorを傘下に置くGoogleによると「コア製品の強化にリソースを集中させる継続的な取り組みの一環」だとのことです。
·gigazine.net·
XやDiscordなどでGIF検索に使われてきた「Tenor」のAPI提供が終了
動画ダウンローダー「yt-dlp」のインストール手順まとめ、wingetコマンドでサクッとインストール可能
動画ダウンローダー「yt-dlp」のインストール手順まとめ、wingetコマンドでサクッとインストール可能
「yt-dlp」はYouTubeなどの動画配信サイトからコンテンツをダウンロードできるコマンドラインツールです。Microsoft公式パッケージ管理ツールの「WinGet」を使うとコマンド一発でインストールできるので、インストール手順を改めてまとめておきます。
·gigazine.net·
動画ダウンローダー「yt-dlp」のインストール手順まとめ、wingetコマンドでサクッとインストール可能
Google画像検索が提供開始25周年を迎えて刷新へ、「AIによる概要」で画像生成が可能に
Google画像検索が提供開始25周年を迎えて刷新へ、「AIによる概要」で画像生成が可能に
Googleが、Google画像検索の提供開始25周年に合わせて、検索前からウェブ上の画像を閲覧できる新しいホーム画面と、検索結果の「AIによる概要」で画像を生成できる機能を発表しました。画像を探すだけでなく、利用者の関心に沿った画像を眺めたり、求める画像をその場で生成したりできるサービスへと刷新されます。
·gigazine.net·
Google画像検索が提供開始25周年を迎えて刷新へ、「AIによる概要」で画像生成が可能に
宇宙空間でのX線写真撮影に成功、宇宙での医療やデバイス非破壊検査への活用が期待される
宇宙空間でのX線写真撮影に成功、宇宙での医療やデバイス非破壊検査への活用が期待される
宇宙空間でX線写真を撮影するミッション「SpaceXray」の成果が2026年7月14日に放射線関連の学術誌であるRadiologyに掲載されました。研究チームは宇宙空間で人体やデバイスのX線写真を撮影することに成功しています。
·gigazine.net·
宇宙空間でのX線写真撮影に成功、宇宙での医療やデバイス非破壊検査への活用が期待される
約1兆パラメーターで画像・音声の理解やコーディングに対応、用途別に調整できるオープンウェイトAIモデル「Inkling」登場
約1兆パラメーターで画像・音声の理解やコーディングに対応、用途別に調整できるオープンウェイトAIモデル「Inkling」登場
AI企業のThinking Machines Labが、用途に合わせた追加学習を重視する新たなAIモデル「Inkling」を発表しました。モデルの重みが公開されるオープンウェイトモデルで、文章だけでなく画像や音声も扱えるほか、思考に使う計算量の調整も可能とのことです。
·gigazine.net·
約1兆パラメーターで画像・音声の理解やコーディングに対応、用途別に調整できるオープンウェイトAIモデル「Inkling」登場
年を取ると人の顔が見分けられなくなるのは「目の動かし方が不安定になるから」かもしれない
年を取ると人の顔が見分けられなくなるのは「目の動かし方が不安定になるから」かもしれない
年を取るにつれて人の顔を見分ける能力が低下することは知られていますが、その仕組みは十分に解明されていません。香港科技大学や香港理工大学などの研究チームは顔認識実験の結果から、顔を見る際の目の動かし方が不安定になることが加齢に伴う顔認識能力の低下の一因になり得ると指摘しています。
·gigazine.net·
年を取ると人の顔が見分けられなくなるのは「目の動かし方が不安定になるから」かもしれない
Grokを悪用して児童性的虐待画像を作成した男性をSpaceXAIが提訴
Grokを悪用して児童性的虐待画像を作成した男性をSpaceXAIが提訴
イーロン・マスク氏が立ち上げたAIスタートアップのSpaceXAI(元xAI)が、AI・Grokを悪用して児童性的虐待画像(CSAM)のディープフェイクを作成したとして逮捕されたサウス・カロライナ州の男性を提訴しました。AIシステムを使ってわいせつなコンテンツを生成したユーザーをAI企業が提訴した初期事例として注目されています。
·gigazine.net·
Grokを悪用して児童性的虐待画像を作成した男性をSpaceXAIが提訴
画像生成AI「Qwen-Image-3.0」が登場したので使ってみた、イラストや日本語テキストの描画性能はいかに
画像生成AI「Qwen-Image-3.0」が登場したので使ってみた、イラストや日本語テキストの描画性能はいかに
中国の大手テクノロジー企業であるAlibabaのAI研究チームが画像生成AI「Qwen-Image-3.0」をリリースしました。Qwen-Image-3.0は「小さな文字を含む画像」を生成することを得意としているほか、物体の質感を細かく表現することもできるとのこと。Qwen Studioのアカウントを作成すれば無料で使用可能だったので使ってみました。
·gigazine.net·
画像生成AI「Qwen-Image-3.0」が登場したので使ってみた、イラストや日本語テキストの描画性能はいかに
NVIDIAがAI動画を最大92%の精度で識別可能なツール「Synthetic Video Detector」を発表
NVIDIAがAI動画を最大92%の精度で識別可能なツール「Synthetic Video Detector」を発表
NVIDIAは、AIで生成された可能性がある動画をフレーム単位で解析する「Synthetic Video Detector」を発表しました。報道機関や放送局などでの利用を想定したAIマイクロサービスで、非圧縮動画では最大92%の精度を記録し、1080p動画を最短22ミリ秒で処理できるとされています。
·gigazine.net·
NVIDIAがAI動画を最大92%の精度で識別可能なツール「Synthetic Video Detector」を発表
モナリザなどをAIに描かせて完成物やコスパを比較、特にGrokだけが飛び抜けて奇妙な結果に
モナリザなどをAIに描かせて完成物やコスパを比較、特にGrokだけが飛び抜けて奇妙な結果に
最先端のAIモデルを一カ所でまとめて試せるプラットフォームのTryAIが、Anthropicが2026年6月10日にリリースしたClaude Fable 5、OpenAIが2026年6月29日に発表したGPT-5.6 Sol、SpaceXAIが2026年7月9日にリリースしたGrok 4.5、Googleが2026年7月22日に発表したばかりのGemini 3.6 Flashという4つのAIに、さまざまな画像を描画させることで各AIのコストパフォーマンスや画像生成性能を比較しています。
·gigazine.net·
モナリザなどをAIに描かせて完成物やコスパを比較、特にGrokだけが飛び抜けて奇妙な結果に
画像も動画も音声も生成できるAI「FLUX 3」が発表される
画像も動画も音声も生成できるAI「FLUX 3」が発表される
AI開発企業のBlack Forest Labsが独自開発のAIモデル「FLUX 3」を発表しました。FLUX 3は「画像」「動画」「音声」の生成に対応したマルチモーダルモデルで、記事作成時点では動画生成機能が早期アクセス版としてリリースされています。
·gigazine.net·
画像も動画も音声も生成できるAI「FLUX 3」が発表される
画像・動画・音声の生成AIモデルを条件に合わせて自動で選ぶ「Runway Media Router」が登場
画像・動画・音声の生成AIモデルを条件に合わせて自動で選ぶ「Runway Media Router」が登場
生成AI企業のRunwayは2026年7月23日、画像・動画・音声の生成に使うAIモデルを自動で選択する「Runway Media Router」を発表しました。開発者向けプラットフォーム「Runway Dev」に追加された新機能で、品質や処理速度、料金の優先順位に合わせて自動で利用モデルを切り替えます。
·gigazine.net·
画像・動画・音声の生成AIモデルを条件に合わせて自動で選ぶ「Runway Media Router」が登場
自分の顔をAIにレンタルする行為が中国で流行
自分の顔をAIにレンタルする行為が中国で流行
顔を無断で使用した動画が権利関係の問題で削除される事例が中国で相次いでいます。こうした状況を逆手に取り、最初から顔の使用権を販売しようとするビジネスモデルが成立していることが伝えられました。
·gigazine.net·
自分の顔をAIにレンタルする行為が中国で流行
Google Earthに追加された「架空の衛星画像を生成するAI機能」がわずか1日で撤回、偽の災害・軍事画像を作成可能だったため
Google Earthに追加された「架空の衛星画像を生成するAI機能」がわずか1日で撤回、偽の災害・軍事画像を作成可能だったため
Googleは画像生成AIモデル「Nano Banana 2」を使ってGoogle Earth上の風景を加工できる画像生成機能を公開しましたが、偽の災害現場や軍事施設などを容易に作成できることが問題視され、提供開始からわずか1日で機能を撤回しました。Googleは、ポリシーに違反するとみられる生成画像のスクリーンショットが共有されていたとして、より強力な安全対策を導入するまで機能を停止すると説明しています。
·gigazine.net·
Google Earthに追加された「架空の衛星画像を生成するAI機能」がわずか1日で撤回、偽の災害・軍事画像を作成可能だったため
フルカラーで見える暗視ゴーグルを可能にする技術が開発される、ただし実用化には課題あり
フルカラーで見える暗視ゴーグルを可能にする技術が開発される、ただし実用化には課題あり
北京理工大学の研究チームが、赤外線の波長と強度を可視光の色と明るさに変換し、人間が赤外線を「フルカラー」で見られるようにする光電変換デバイスを開発しました。試作した半透明のメガネ型装置は重さ23gで、従来の単色表示よりも微細な赤外線の違いを識別しやすく、暗所での視認や拡張現実、視覚補助技術への応用が期待されています。
·gigazine.net·
フルカラーで見える暗視ゴーグルを可能にする技術が開発される、ただし実用化には課題あり
動画生成AI「FLUX 3 Video」が一般公開される、1080p・20秒の動画を生成可能で近日中にオープンモデルも公開予定
動画生成AI「FLUX 3 Video」が一般公開される、1080p・20秒の動画を生成可能で近日中にオープンモデルも公開予定
AI開発企業のBlack Forest Labsが動画生成AI「FLUX 3 Video」を現地時間の2026年8月4日に一般公開しました。FLUX 3 Videoは最大20秒・1080p(フルHD)の音声付き動画を生成可能です。
·gigazine.net·
動画生成AI「FLUX 3 Video」が一般公開される、1080p・20秒の動画を生成可能で近日中にオープンモデルも公開予定
Mistral AIが小型モデレーションAI「Shieldstral」を公開、文章や画像を自然言語のルールで判定可能
Mistral AIが小型モデレーションAI「Shieldstral」を公開、文章や画像を自然言語のルールで判定可能
フランスのAI企業Mistral AIが2026年8月4日、文章や画像が指定した安全基準に当てはまるかを判定するAIモデル「Shieldstral 1.0 3B」を公開しました。パラメーター数は30億で、サービスごとの安全基準を自然な文章で指定できる点が特徴です。
·gigazine.net·
Mistral AIが小型モデレーションAI「Shieldstral」を公開、文章や画像を自然言語のルールで判定可能
アニメーションっぽく画像が動く「レグレッシブJPEG」とは?
アニメーションっぽく画像が動く「レグレッシブJPEG」とは?
「レグレッシブJPEG」とはJPEGのプログレッシブ表示機能とスキャン範囲の制御を利用して単一の画像ファイル内に複数の画像を埋め込み、アニメーションやビデオのように見せる技術です。レグレッシブJPEGとはどんなものかについては以下のブログサイトで解説しています。
·gigazine.net·
アニメーションっぽく画像が動く「レグレッシブJPEG」とは?