Voix off
Générez une narration claire pour les démonstrations de produits, les explications et les processus de support.
Modèles audio
Découvrez Qwen Audio 3.0, LiveTranslate, Fun ASR, CosyVoice, musique et les chemins Omni Qwen pour la synthèse, la transcription, la traduction et les workflows audio en temps réel.
Flux audio
Les aperçus uniquement avec des exemples montrent les workflows que ces routes Alibaba peuvent soutenir.
Générez une narration claire pour les démonstrations de produits, les explications et les processus de support.
Créez des boucles légères, de l'ambiance d'interface et des fonds sonores de campagne.
Transformez les appels, les entretiens et les narrations de démonstration en flux de texte recherchables.
10 itinéraires
Itinéraires audio, musique et multimédia avec paramètres, estimations et chemins d'accès à Alibaba Cloud.
Alibaba Cloud
CosyVoice V3.5 Plus est la route de synthèse vocale text-to-speech d'Alibaba pour la sortie vocale générée. Nfero le présente comme faisant partie de la pile audio aux côtés des modèles ASR, musique et Qwen Omni.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Fun ASR est la route de reconnaissance vocale d'Alibaba pour transformer l'audio en texte. Nfero le relie à la transcription, à la compréhension audio, au RAG et à la planification de workflows d'agents.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Fun ASR Flash 2026-06-15 est la version actuelle d'Alibaba pour la reconnaissance non en temps réel des fichiers audio multilingues. Nfero enregistre l'ID exact du modèle et le chemin d'accès officiel pour la planification de l'implémentation.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Fun ASR Realtime est le chemin recommandé par Alibaba pour la reconnaissance vocale multilingue continue et les dialectes pris en charge. Nfero documente le chemin de planification alors que la transcription publique reste désactivée.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Fun Music V1 est le chemin de génération musicale à partir de texte d'Alibaba dans le catalogue audio Nfero. Il est positionné pour l'exploration créative, l'idée musicale et la planification du workflow audio.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Qwen Audio 3.0 TTS Flash est le chemin de synthèse vocale à faible latence pour les workflows interactifs de parole et de clonage de voix. Alibaba indique un temps avant la première audio inférieur à 200 ms sous des conditions prises en charge.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Qwen Audio 3.0 TTS Plus est le chemin de synthèse vocale de haute qualité pour les sorties vocales professionnelles et la livraison contrôlée par instruction. Nfero documente son accès international et sa base de prix listé sans révéler de synthèse publique non vérifiée.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Qwen3.5 LiveTranslate Flash Realtime combine le contexte audio et visuel pour la traduction multilingue, avec une latence pouvant aller jusqu'à 2,8 secondes sous conditions prises en charge. Nfero documente le chemin sans affirmer l'accès public.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Qwen3.5 Omni Plus est le chemin multimodal d'Alibaba pour combiner la compréhension ou la génération de textes, images, audio et vidéos. Nfero le place dans la surface plus large d'Omnis et de planification d'agents.
Meilleur pour : Parole, transcription et workflows audio
Alibaba Cloud
Qwen3.5 Omni Plus Realtime est le chemin d'accès à faible latence pour des expériences multimodales interactives. Nfero l'utilise pour la planification en temps réel, les audio et les workflows Alibaba orientés vers les agents.
Meilleur pour : Parole, transcription et workflows audio
Preuve open source
Qwen3-TTS, Qwen3-ASR et Qwen3-Omni facilitent la compréhension par les acheteurs des workflows audio et multimodaux d'Alibaba.