Кратко
Alibaba представила Qwen3.5-Omni — новую мультимодальную AI-модель, способную обрабатывать текст, изображения, аудио и видео в реальном времени. Модель ориентирована на трансформацию идей в готовые продукты, предлагая широкий спектр функций для автоматизации и ускорения различных рабочих процессов.
- Функция Audio-Visual Vibe Coding позволяет генерировать рабочие сайты или игры по голосовому описанию.
- Модель поддерживает до 10 часов аудио или 400 секунд 720p видео в контексте, обучена на более чем 100 млн часов данных.
- Qwen3.5-Omni превосходит Gemini-3.1 Pro в аудиообработке и сопоставима в аудиовизуальных задачах.
- Поддерживает распознавание речи на 113 языках и полноценный диалог на 36 языках.
- Линейка включает версии Plus, Flash и Light для разных задач: от сложных проектов до локального запуска.