Tongyi Qianwen d'Alibaba a lancé la série Qwen-Audio-3.1, introduisant cinq nouveaux modèles vocaux qui constituent une pile audio complète couvrant la compréhension, la génération, l'interaction et la création. Cette mise à niveau comprend des modèles fondamentaux améliorés pour la reconnaissance vocale, la synthèse et l'interaction en temps réel, ainsi que de nouvelles variantes TTS-Next et ASR-Next. Les prix de l'ensemble de la gamme Qwen-Audio ont été considérablement réduits afin de diminuer les coûts pour les utilisateurs. Les tarifs de la synthèse vocale ont baissé d'environ 70 %, les frais d'interaction vocale en temps réel ont chuté d'environ 85 %, et les coûts de la reconnaissance automatique de la parole ont été réduits jusqu'à 95 %.