L'équipe Qwen d'Alibaba a publié en open source Qwen-Image-2.1, un modèle visuel de 7 milliards de paramètres qui intègre la génération d'images à partir de texte et l'édition d'images au sein d'une architecture unique. Cette version combine nativement ces deux capacités, rationalisant ainsi les flux de travail des créateurs et des développeurs qui travaillent avec des visuels générés par IA. Le modèle prend en charge la génération et l'édition d'images transparentes, accepte jusqu'à 10 images de référence pour la composition multi-images et permet l'édition locale grâce à des outils de sélection et d'inpainting. Il offre également une fidélité améliorée pour l'édition de portraits et de produits, ainsi qu'un rendu optimisé de la mise en page du texte.