| Stable Diffusion Stable Diffusion | |
|---|---|
![]() Stable Diffusion 3.5で生成された「馬に乗る宇宙飛行士」の画像(出典:ウィキメディア・コモンズ) | |
| サイト名 | Stable Diffusion |
| 言語 | 英語(プロンプトは英語が基本。日本語特化派生モデルあり) |
| タイプ | 画像生成AI(テキストから画像を生成する拡散モデル) |
| 国 | イギリス(Stability AI)/ドイツ(CompVis) |
| 種類 | オープンウェイトの生成AIモデル |
| 創設 | 2022年8月22日(初版公開) |
| 創設者 | Stability AI、CompVis(ミュンヘン大学)、Runway |
| 運営者 | Stability AI |
| 収益 | 企業向けライセンス、API、エンタープライズ向けサービス |
| 営利性 | 営利(モデル本体は条件付きで無償公開) |
| 登録 | ローカル実行には不要(公式API・Webサービスは登録制) |
| 開始 | 2022年8月22日 |
| 現在の状態 | 稼働中(最新の主力は Stable Diffusion 3.5 系) |
| 別名 | SD、SD1.5、SDXL、SD3、SD3.5 |
| リンク | https://stability.ai/ |
概要[編集]
Stable Diffusion(ステーブル・ディフュージョン)とは、イギリスのAI企業Stability AIが、ドイツ・ミュンヘン大学の研究グループCompVis、米国のRunwayらと開発し、2022年8月22日に公開したテキストから画像を生成するAIモデルである。最大の特徴は、学習済みの「重み」そのものが一般公開され、個人のPCで動かせる点にある。これが改造モデル・LoRA・専用UIといった巨大なコミュニティ文化を生み、生成AIブームの火付け役になると同時に、著作権・ディープフェイクをめぐる論争の中心にもなった。
詳細[編集]
「誰でも手元で動かせる」画像生成AI[編集]
2022年の春から夏にかけて、OpenAIの「DALL·E 2」やMidjourneyといった画像生成AIが相次いで話題になったが、これらはいずれも企業のサーバー上で動くサービスで、利用者は完成した画像を受け取るだけだった。Stable Diffusionはここが根本的に違い、モデルのファイル自体をダウンロードして、自分のGPUで、オフラインでも動かせる。
この「オープンウェイト」方式により、誰でもモデルを追加学習(ファインチューニング)したり、改造版を配布したりできるようになった。アニメ絵に特化したモデル、実写に特化したモデル、特定のキャラクターや画風だけを覚えさせた小さな差分ファイル(LoRA)などが爆発的に生まれ、「本家より派生の方が使われている」状態が長く続いている。
オープンソースではなく「オープンウェイト」[編集]
しばしば「オープンソースの画像生成AI」と紹介されるが、厳密にはソフトウェアの世界でいうオープンソース(OSIの定義)とは異なる。初期版はCreativeML OpenRAIL-Mという独自ライセンスで公開され、犯罪・名誉毀損・ハラスメント・ドキシング(個人情報晒し)・未成年の搾取などへの使用を禁じる条項が付いていた。
SD3以降は「Stability AI Community License」に切り替わり、研究・非商用や、年間売上100万ドル未満の個人・企業は無償で商用利用できる一方、それを超える企業は有償のエンタープライズライセンスが必要になった。つまり「重みは公開されているが、使い方には条件がある」というのが正確な位置づけで、この点は後述するSD3ライセンス騒動の火種にもなった。
仕組みをざっくり[編集]
Stable Diffusionは「潜在拡散モデル(Latent Diffusion Model)」と呼ばれる方式を使う。拡散モデルは、画像にノイズを少しずつ加えていく過程を逆にたどり、ノイズだらけの状態から少しずつノイズを取り除いて画像を「浮かび上がらせる」仕組みである。
ポイントは、この作業を画像のピクセルそのものではなく、VAE(変分オートエンコーダ)で圧縮した小さな「潜在空間」で行うこと。これにより計算量が大幅に減り、家庭用GPUでも動くようになった。初期版の構成は、画像を圧縮・復元するVAE、ノイズを取り除く約8億6,000万パラメータのU-Net、そして文章の意味を読み取る約1億2,300万パラメータのCLIPテキストエンコーダの3つ。SD3からはU-NetをTransformerに置き換えた「MMDiT(マルチモーダル拡散トランスフォーマー)」という別物の構造になっている。
学習データとLAION[編集]
初期モデルの学習には、ドイツの非営利団体LAIONがインターネット上から収集した画像と説明文のペア約58億組のデータセット「LAION-5B」のサブセットが使われた。特に「美しさ」スコアで絞り込んだLAION-Aesthetics(約6億枚)が重要な役割を果たしている。学習にはAWS上のNVIDIA A100 GPU 256基が使われ、約15万GPU時間、費用は約60万ドルとされる。
ある調査では、学習データの画像の約47%がわずか100のドメインに由来し、WordPress、Blogspot、Flickr、DeviantArt、ウィキメディア・コモンズなどが上位を占めたとされる。ネット上の画像を許諾なしに集めて学習している、という点こそが、後の訴訟と反発の根本にある。
歴史[編集]
誕生(2022年)[編集]
土台となった潜在拡散モデルの論文は、ミュンヘン大学(LMU)のCompVisグループのロビン・ロンバッハ(Robin Rombach)らによるもの。これにStability AIが計算資源を提供し、Runwayが開発に参加、LAIONがデータセットを提供する形でStable Diffusionが作られた。初期論文の著者5人のうち4人(ロンバッハ、アンドレアス・ブラットマン、パトリック・エッサー、ドミニク・ローレンツ)は、のちにStability AIに移って後続版の開発を担った。
2022年8月22日に一般公開されると、わずか数週間でGitHub上に数えきれないほどのツールが登場した。同じ8月22日には、後に定番UIとなる「AUTOMATIC1111版 Stable Diffusion web UI」も最初のリリースを迎えている。10月20日にはRunwayがv1.5を公開。このSD1.5は長く改造モデルの土台として使われ続け、「SD1.5系」という一大ジャンルを形成した。
急拡大とバージョンアップ(2022〜2023年)[編集]
2022年10月、Stability AIはCoatueとLightspeed Venture Partnersが主導する1億100万ドルの資金調達を実施し、評価額は10億ドルに達した。いわゆるユニコーン企業の仲間入りである。11月にはv2.0、12月にはv2.1が出たが、学習データから成人向け画像を大幅に除外したことなどから、コミュニティでは「1.5の方が使いやすい」という評価が根強かった。
2023年7月には「SDXL 1.0」が登場。パラメータ数は約35億に増え、標準解像度が1024×1024に引き上げられ、手足や文字の描写も改善された。11月には1ステップで画像を出せる高速版「SDXL Turbo」を公開。同月、Stability AIは日本語の入力と日本的な表現に対応した「Japanese Stable Diffusion XL」も公開している。
SD3の難産(2024年)[編集]
2024年2月にStable Diffusion 3が発表され、6月には中型版「SD3 Medium」の重みが公開された。しかし当初のライセンス条件が不明瞭で商用利用のハードルが高いと受け止められたうえ、人体、とくに「芝生に寝そべる女性」を描かせると手足が崩壊するという画像が大量に出回り、ネットミーム化してしまった。モデル配布サイト大手のCivitaiはライセンスの不明瞭さを理由にSD3関連コンテンツを一時的に禁止した。
これを受けてStability AIは2024年7月5日にライセンスを改訂し、年間売上100万ドル未満なら無償で商用利用できる現行のCommunity Licenseへ移行。10月には改良版「Stable Diffusion 3.5」(Large/Large Turbo/Medium)を公開し、2025〜2026年時点でも同社の主力画像モデルとなっている。
分家「FLUX」の誕生[編集]
2024年、Stability AIの経営難の中で、ロンバッハら中核研究者が同社を離れ、ドイツで新会社「Black Forest Labs」を立ち上げた。同社が2024年8月に公開した画像生成モデル「FLUX.1」は高い描写力で注目を集め、オープンウェイト画像生成の主役の座をStable Diffusionから奪う形になった。現在のローカル生成コミュニティでは、SD系とFLUX系が併用されるのが一般的である。
また2024年8月末には、SD1.5を公開していたRunwayがHugging Face上の公式リポジトリを削除し、依存していた多数のツールでエラーが出る騒ぎがあった。現在は有志がミラーしたリポジトリが事実上の代替として使われている。
ツールとコミュニティ文化[編集]
AUTOMATIC1111とComfyUI[編集]
Stable Diffusionを一般ユーザーに広めた最大の立役者が、匿名開発者AUTOMATIC1111による「Stable Diffusion web UI」(AUTOMATIC1111)である。ブラウザ上で動くGradioベースの画面から、プロンプトの重み付け、img2img、インペインティング、アップスケール、20種類以上のサンプラーなどを操作でき、拡張機能で何でも追加できる。GitHubのスター数は2024年7月時点で13万6,000を超え、「ローカルで拡散モデルを動かす最も人気のツール」と評された。ControlNetの作者Lvmin Zhang(lllyasviel)による軽量フォーク「Forge」も広く使われている。
一方、2023年1月に匿名開発者comfyanonymousが公開した「ComfyUI」は、処理の流れをノード(箱)と線でつなぐワークフロー型のUI。見た目はとっつきにくいが、細かい制御と新モデルへの対応の速さで支持を広げ、2026年時点ではGitHubスター12万超の定番ツールとなった。開発者はStability AIに在籍していたが2024年6月までに離れ、中核開発者と「Comfy Org」を設立している。
LoRA・ControlNet・マージモデル[編集]
Stable Diffusion文化を語るうえで欠かせないのが「LoRA」。もともとはMicrosoftの研究者が大規模言語モデル向けに考案した軽量な追加学習手法で、2022年末ごろから画像生成に転用された。数十枚程度の画像から、特定のキャラクター、衣装、画風、ポーズなどを覚えさせた数十〜数百MBの差分ファイルを作れるため、「キャラLoRA」「画風LoRA」が大量に流通するようになった。
2023年2月に登場した「ControlNet」は、線画や棒人間のポーズ、深度マップなどを条件として与え、構図を思い通りに指定できる拡張機能。さらに複数のモデルを混ぜ合わせる「マージモデル」文化も生まれ、日本では特にアニメ・イラスト調のマージモデルが数多く作られた。
Civitaiという「モデル市場」[編集]
こうした改造モデルやLoRAの集積地となったのが、2022年に米国アイダホ州でジャスティン・メイヤー(Justin Maier)が立ち上げた「Civitai」である。2023年1月に10万人だった利用者は同年11月には300万人に達し、同月には大手VCのアンドリーセン・ホロウィッツから出資を受けた。ただし、実在人物の性的画像や、未成年を想起させる画像の生成をめぐって批判も多く、2023年12月には提携していたクラウド企業OctoMLが提携を打ち切っている。
2025年5月にはクレジットカード決済網の圧力を背景に、実在人物の容姿を再現するモデルの削除と成人向けコンテンツの規制強化に踏み切った。同年7月には英国のオンライン安全法への対応コストを理由に英国からのアクセスを遮断。2026年4月には一般向けの「civitai.com」と成人向けの「civitai.red」の2ドメイン体制に移行し、成人向け側の支払いは暗号資産のみとする形で決済問題に対応したと報じられている。
日本での受け止め[編集]
イラストレーターの反発[編集]
日本はアニメ・漫画・イラスト文化が厚く、PixivやSkebのようなクリエイター向けプラットフォームが充実していたこともあり、画像生成AIへの反発が特に強く表れた国の一つである。Stable Diffusion公開直後の2022年8月29日には、国内企業が特定のイラストレーターの画風を学習させる「mimic」のベータ版を公開したが、他人の絵を無断で学習させる悪用への懸念から炎上し、翌30日には全機能を停止した(その後、再開を経て2025年6月30日にサービスを終了)。
X (SNS)などのSNSでは「AI学習禁止」をプロフィールや作品に明記するイラストレーターが増え、AI生成画像を自作と偽って投稿する行為や、特定作家の画風を学習させたLoRAの配布に対する抗議が繰り返されてきた。一方で、生成AIを制作補助として使うクリエイターや、AIイラストを専門に投稿する層も生まれ、賛否は現在も二分されている。
NovelAI騒動との関係[編集]
日本での反発を決定づけた出来事の一つが、2022年10月にサービスを開始した「NovelAI Diffusion」である。NovelAIは米Anlatanが運営する有料サービスで、Stable Diffusionをベースに、アニメ調イラストで高い品質を出したことから日本で爆発的に話題となった。学習元として無断転載サイトDanbooruの画像とタグが使われたとされたことから、「絵師の作品を勝手に学習している」という批判が一気に広がった。
さらにサービス開始直後、NovelAIは不正アクセスを受けてソースコードなどが流出したと公表。流出したとされるモデル(通称「NAIリークモデル」)は無料で出回り、Stable Diffusionの改造モデルの系譜に深く入り込んだ。このときAUTOMATIC1111も、流出コードを使ったとの疑惑からStability AIのDiscordを一時追放されたが、2022年10月13日にはエマド・モスタークCEOがGitHub上で公開謝罪している。NovelAIは2024年8月、旧モデルを非商用ライセンスで公式公開した。
プラットフォーム側の対応[編集]
pixivは2022年10月にAI生成作品を区別・非表示にできるフィルタを導入し、2023年5月31日には規約を改定して、クリエイターに無断で作品をAIに学習させて不利益を与える行為などを禁止した。Pixiv FANBOXでも2023年7月にAI生成作品に関する規約改定が行われている。Skebは生成AIによる作品の納品を禁止する方針をとってきた。
著作権法30条の4と文化庁の考え方[編集]
日本の議論で必ず登場するのが著作権法30条の4である。2018年改正で設けられたこの条文は、著作物に表現された思想や感情を「享受」することを目的としない利用、たとえばAIの学習のための複製を、原則として権利者の許諾なしに認めている。このため日本は海外から「機械学習パラダイス」と呼ばれることもあった。
文化庁は2024年3月15日に「AIと著作権に関する考え方について」を公表し、整理を示した。それによると、学習段階でも、学習データの著作物と類似したものを意図的に出力させる目的の学習や、特定クリエイターの少量の作品だけを使った追加学習などは、30条の4の「ただし書」により許されない場合があるとされる。生成・利用段階では、通常の著作権侵害と同じく「類似性」と「依拠性」で判断され、学習データに含まれていれば依拠性が推認されうるとした。一方、「作風」そのものはアイデアとして著作権の保護対象外とされている。
訴訟[編集]
ゲッティイメージズ訴訟(英国)[編集]
2023年、写真素材大手のゲッティイメージズ(Getty Images)は、数百万枚の画像を無断で学習に使ったとしてStability AIを英国と米国で提訴した。初期のStable Diffusionが、ゲッティの透かし(ウォーターマーク)らしき模様の入った画像を出力してしまうことが証拠として注目された。
英国高等法院は2025年11月4日に判決を出した。ゲッティは学習が英国内で行われたことを立証できず、学習行為そのものに関する主張を途中で取り下げていた。残った「モデル自体が侵害物である」という二次侵害の主張について、裁判所は「AIモデルは学習によって得られた統計的なパラメータを含むもので、写真の複製や再構成を保存しているわけではない」として退け、商標侵害もごく限定的な範囲でしか認めなかった。ゲッティ側の実質的な敗訴と報じられている。
ただし2026年1月、担当判事は二次侵害の論点について「合理的な法律家の間でも見解が分かれうる純粋な法律問題」として控訴を許可しており、英国での争いは控訴審に持ち越された。
ゲッティイメージズ訴訟(米国)[編集]
米国ではデラウェア州で係属していた訴訟をゲッティが2025年8月に取り下げ、カリフォルニア北部地区連邦地裁で改めて提訴した。2026年4月23日、裁判所はStability AIの却下申立ての大半を退け、商標侵害や不正競争などの主張を審理に進めることを認めた。一方で、著作権管理情報(DMCA)に関する主張は「意図」の主張が不十分として棄却(再提起は可能)している。
Andersen v. Stability AI(アーティスト訴訟)[編集]
2023年1月13日、イラストレーターのサラ・アンダーセン、ケリー・マッカーナン、カーラ・オルティスらが、Stability AI、Midjourney、DeviantArt(のちにRunwayも)を相手取り、カリフォルニア北部地区連邦地裁に集団訴訟を起こした。ネット上から無断収集した約50億枚の画像で学習し、数百万人のアーティストの権利を侵害したという主張である。
2023年10月の決定では多くの請求が退けられたが、学習時の直接侵害の主張は残された。2024年8月12日の決定でウィリアム・オリック判事は、著作物が「アルゴリズム的・数学的な表現としてStable Diffusionに含まれている可能性がある」とする原告の主張を排斥せず、直接侵害・誘引侵害・商標関連の請求を審理に進めた。2026年2月には第3次修正訴状が提出され、証拠開示手続きが続いている。公判は2027年4月に予定されていると報じられている。英国ゲッティ判決と米国アンダーセン訴訟とで「モデルの中に作品は含まれるのか」という核心部分の扱いが異なる点が注目されている。
Stability AIの経営混乱と最新動向[編集]
エマド・モスタークの辞任(2024年)[編集]
Stability AIは2019年、エマド・モスタークらがロンドンで創業した。モスタークは「オープンなAI」の旗手として積極的に発信し、Stable Diffusionの成功で一躍時の人となったが、会社は膨大な計算費用に苦しんだ。2023年10月時点で月約800万ドルを支出し、評価額40億ドルでの資金調達にも失敗したと報じられている。共同創業者のサイラス・ホーデスが「だまされて持ち分を売らされた」として2023年7月に訴訟を起こすなど、内紛も表面化した。
2024年3月22〜23日、モスタークはCEOを辞任。「中央集権的なAIに、より中央集権的なAIで勝つことはできない」と述べ、分散型AIに注力するとした。前後して中核研究者の流出も相次ぎ、暫定的にCOOとCTOの共同CEO体制となった。
再建(2024〜2025年)[編集]
2024年6月25日、VFX大手Weta Digitalの元CEOプレム・アッカラジュ(Prem Akkaraju)が新CEOに就任し、ナップスター共同創業者で元Facebook社長のショーン・パーカーが執行会長に就いた。元Google CEOのエリック・シュミットらも参加した約8,000万ドルの出資に加え、取引先に1億ドル超の債務と3億ドルの将来の支払い義務を免除させたと報じられている。
新体制は「エンタメ・広告業界向けのプロ用ツール」路線に舵を切った。2025年3月には広告大手WPPから出資を受け、「アバター」「タイタニック」の視覚効果で知られるロバート・レガートを迎え入れた。同年はNVIDIA、AMD、Armとの最適化協業、Amazon Bedrockへの画像サービス提供、音声生成「Stable Audio 2.5」の公開などが続き、10月にはエレクトロニック・アーツ(EA)、ユニバーサル ミュージック グループ、11月にはワーナー・ミュージック・グループとの提携を発表した。
2026年の動き[編集]
2026年2月には児童の性的搾取対策に取り組む業界団体Tech Coalitionに加盟。4月にはブランド素材をもとに広告制作を行う「Brand Studio」、5月には完全にライセンス済みのデータで学習したという音声モデル「Stable Audio 3.0」を発表した。8月25日には総額2億3,200万ドル規模のシリーズBとして7,600万ドルの追加調達を発表し、ユニバーサル、ソニーミュージックグループ、ワーナーの3大レーベルとEA、AMD Venturesなどが出資に名を連ねた。
ただし近年の発表の中心は企業向けサービスや音楽・動画で、2024年10月のSD3.5以降、Stable Diffusionの名を冠した新しい大型画像モデルの一般公開は目立っていない。コミュニティの関心がFLUXなど他のオープンウェイトモデルに分散する中、「Stable Diffusion」は同社の看板でありつつ、ローカル生成文化の総称のような存在になりつつある。
アダルト利用・ディープフェイク問題[編集]
オープンウェイトで手元で動かせ、フィルタも外せるという性質上、Stable Diffusionとその派生モデルは成人向け画像の生成に広く使われてきた。成人向けに特化した改造モデルやLoRAが大量に流通し、生成画像を販売する動きも生まれた。
問題になったのは、実在人物の性的ディープフェイクと、児童を描いた画像である。2023年6月にはBBCが、Stable Diffusionで作られた児童性的虐待画像が取引され、pixivなどが宣伝に使われていると報じた。同年12月には、スタンフォード大学インターネット観測所がLAION-5Bの中に児童性的虐待が疑われる画像へのリンクが含まれていたと報告し、LAIONはデータセットを一時公開停止。2024年8月31日に問題リンクを削除した「Re-LAION-5B」を公開している。
日本では2025年4月、生成AIで作った実在しない女性の裸の画像をポスターに印刷してネットオークションで販売したとして、警視庁が男女4人を逮捕した。個人のPCに取り込んだ無料の生成AIソフトを使ったとされ、生成AIによる画像を「わいせつ物」として摘発した国内初のケースと報じられた。米国では2025年5月に、同意のない性的画像(AI生成を含む)の公開を処罰し、プラットフォームに削除対応を義務付ける「Take It Down Act」が成立している。
他サービスとの比較[編集]
| サービス | 運営 | 登場 | 提供形態 | 特徴 |
|---|---|---|---|---|
| Stable Diffusion | Stability AI(英) | 2022年8月 | オープンウェイト(ローカル実行可)+API | 改造・追加学習が自由。LoRAやマージモデルの文化。無料で使えるがPCスペックが必要 |
| Midjourney | Midjourney(米) | 2022年7月(公開ベータ) | クラウド(有料サブスク) | 美麗な絵作りに定評。当初はDiscord経由、現在はWeb版中心。2026年3月にV8をアルファ公開 |
| DALL·E / ChatGPTの画像生成 | OpenAI(米) | 2021年(DALL·E) | クラウド(ChatGPTに統合) | 会話で指示を出せる手軽さ。2025年3月以降はGPT-4o系の画像生成に移行し「ジブリ風」ブームも |
| NovelAI Diffusion | Anlatan(米) | 2022年10月 | クラウド(有料サブスク) | アニメ調イラスト特化。日本で人気が高い。2026年8月のV5で日本語プロンプトに公式対応 |
ざっくり言えば、MidjourneyやChatGPTは「お金を払えば誰でもすぐ高品質な絵が出る」完成品サービス、NovelAIは「アニメ絵特化の完成品」、Stable Diffusionは「自分で組み立てて改造する素材」という違いがある。自由度が最も高い代わりに、導入と学習のハードルも最も高い。
よくある質問[編集]
Stable Diffusionとは何?[編集]
英Stability AIが2022年8月に公開した画像生成AIモデル。文章(プロンプト)を入力すると画像を生成する。モデルの重みが公開されているため、自分のPCにインストールして無料で動かしたり、改造したりできるのが最大の特徴。
無料で使える?[編集]
モデル本体は無償でダウンロードでき、自分のPCで動かす限り利用料はかからない(電気代とPCは必要)。Stability AIの公式APIや、各社のWebサービス経由で使う場合は有料プランやクレジット制のものが多い。
商用利用できる?[編集]
バージョンによって条件が異なる。SD1.x・2.xはCreativeML OpenRAIL-Mライセンスで、禁止用途に当たらなければ生成画像の商用利用は可能とされる。SD3以降のCommunity Licenseでは、年間売上100万ドル未満の個人・組織は無償で商用利用でき、それ以上はエンタープライズライセンスが必要。派生モデルやLoRAには作者独自の条件(商用禁止など)が付いている場合があり、そちらにも従う必要がある。
日本語で使える?[編集]
本家のモデルは英語プロンプトが前提で、日本語を入力しても意図どおりにならないことが多い。日本語対応としては、rinnaが2022年9月に公開した「Japanese Stable Diffusion」や、Stability AIが2023年11月に公開した「Japanese Stable Diffusion XL」がある。AUTOMATIC1111版やComfyUIには有志による日本語化拡張もある。
違法?著作権は大丈夫?[編集]
Stable Diffusionを使うこと自体は日本でも違法ではない。日本の著作権法30条の4により、AIの学習目的の複製は原則として許諾なしに認められているが、文化庁の整理では、特定作家の作品を狙い撃ちした追加学習などは例外になりうるとされる。生成した画像が既存の著作物と似ていて、それに依拠していると認められれば、通常の著作権侵害になりうる。実在人物の性的画像の作成・公開や、わいせつ物の販売などは別の法律で処罰の対象となる。海外ではゲッティやアーティストによる訴訟が続いており、法的な決着はまだついていない。
PCスペックはどれくらい必要?[編集]
一般に、VRAM(ビデオメモリ)の多いNVIDIA製GPUが推奨される。初期版は最適化すれば約2.4GBのVRAMでも動作するとされるが、快適に使うには10GB以上が目安とされる。SDXLやSD3.5 Large、FLUXなど新しい大型モデルほど要求は上がり、12〜16GB以上あると選択肢が広がる。AMD製GPUやApple Silicon搭載Macでも動かせるが、対応ツールや速度に差がある。
炎上とバズ[編集]
- SD3「芝生の女性」ミーム:2024年6月のSD3 Medium公開直後、芝生に横たわる女性を生成させると手足がありえない形に絡まった画像が出ることが話題になり、「SD3の失敗」を象徴するミームとして世界中で拡散された。
- AUTOMATIC1111追放と謝罪:2022年10月、NovelAIの流出コードを使ったとの疑惑でAUTOMATIC1111がStability AIのDiscordを追放されたが、数日後にエマド・モスタークが公開謝罪。AUTOMATIC1111は「昨日お茶の席で直接謝ってもらったじゃないか」と返した。
- ComfyUI拡張機能の乗っ取り:2024年6月、ComfyUI向け拡張機能の一つが「アーティストの権利を守る」と主張するハッカー集団に改ざんされ、利用者の情報が狙われる事件が起きた。
- mimicの1日停止:Stable Diffusion公開の1週間後、国内の画風学習サービス「mimic」が公開翌日に全機能停止に追い込まれ、日本での「AI絵」論争の幕開けとなった。
余談[編集]
- Stable DiffusionとAUTOMATIC1111版web UIは、奇しくも同じ2022年8月22日に最初のリリースを迎えている。
- 初期モデルの学習費用は約60万ドルとされ、当時の大規模AIとしては「意外と安い」ことも話題になった。
- 初期のモデルが手や指の描写を苦手としたのは、学習データの手足の画像の質が低かったためとも指摘されている。「指が6本」はAI絵を見分ける目印として長く語られた。
- SD1.5の公式リポジトリはRunwayの削除によって消えてしまい、現在は有志が保存したコピーが事実上の「本家」として使われるという、オープンウェイトならではの状況になっている。
- Stability AIの2026年のシリーズBには、ユニバーサル・ソニー・ワーナーの世界3大レコード会社がそろって出資している。かつて「無断学習」で批判された会社が、権利者側と組むという形で再建を進めている。
