アリババのQwenチームは、テキストから画像を生成する機能と画像編集機能を単一のアーキテクチャに統合した、70億パラメータのビジュアルモデル「Qwen-Image-2.1」をオープンソースとして公開しました。今回のリリースは、両方の機能をネイティブに組み合わせたもので、AI生成ビジュアルを活用するクリエイターや開発者のワークフローを効率化します。 本モデルは、透過画像の生成と編集をサポートし、複数画像の合成のために最大10枚の参照画像を受け付けるほか、選択ツールやインペインティング(画像補完)ツールによる局所的な編集を可能にします。また、ポートレートや商品画像の編集における忠実度が向上しているほか、テキストレイアウトのレンダリングも改善されています。