Подборка новых моделей

✦ Ray3: видео-модель от Luma AI

Генерация видео в 1080p 16-bit HDR на 5 - 9 сек. Модель анализирует и понимает промпты. Можно задать логику движения объектов и камеры через визуальные пометки (стрелки и обводка). Симулирует физику, свет и движения с высоким уровнем реализма — подробнее

Есть бесплатный тест в Dream Machine

✦ Wan 2.2 14B Animate от Alibaba для анимации и замены персонажей

Модель передает тонкие движения мимики и пальцев. Доступны два режима: анимация и замещение персонажей. Доступны две версии: Dev (открытая для сообщества) и Pro (для создателей контента). Pro требует 80 ГБ видеопамяти, Dev работает на RTX 4090. Видео 720p и 480p через API и платформу — подробнее - Демо HF - Демо MS - GitHub

✦ Qwen3-Omni: модель для общения в видеочате

Можно взаимодействовать через видеочат. Она принимает текст, изображения, аудио и видео, а также отвечает текстом и голосом. Поддерживает русский язык, работает в режиме реального времени (задержка 211 мс). Показывает высокое качество в 22 из 36 бенчмарков — подробнее - Чат Omni - Демо HF - GitHub - HuggingFace

✦ Grok 4 Fast от xAI: быстрая и дешёвая версия Grok 4

Контекстное окно в 2 млн токена. Модель может искать информацию в интернете и переходить по ссылкам, совмещает два режима: обычный и рассуждений. В LMArena занимает уровень Grok 4 и Claude Opus 4. Grok 4 Fast в 47 раз дешевле, чем Grok 4: ввод $0.20 за 1M токенов (fast) и $0.40 (full), вывод $0.50 за 1M токенов (fast) и $1.00 (full) — подробнее

✦ Stable Audio 2.5: аудио-модель для корпоративного производства

Модель обучена на лицензированных данных, безопасна для корпоративных клиентов. Есть API и локальные решения. Генерация звука с четкой структурой: интро, развитие, аутро. Поддерживаются режимы text-to-audio, audio-to-audio и inpainting. Бесплатно доступны 10 генераций в месяц, Pro-версия - $12 за 250 треков — подробнее

✦ MiMo-Audio: LLM от Xiaomi с поддержкой речи

Модель для генерации и понимания речи. Обучена на более чем 100 миллионах часов речи. Использует уникальную токенизацию. Обучение проходит в два этапа: реконструкция аудио, потом генерация. MiMo-Audio показывает результаты, сравнимые с Gemini 2.5 Flash на бенчмарках — подробнее - GitHub - HuggingFace

✦ Chatterbox Multilingual: клонирование голосов

Способна захватывать интонации и характеристики речи из небольших фрагментов. Модель позволяет создать виртуального двойника любого голоса для озвучивания текста — Демо HF - GitHub

✦ Spectral Labs представила ИИ создания 3D-моделей в CAD

ИИ может формировать детали в формате STEP (можно потом редактировать в CAD-программах). Генерация из текстовых промптов или изображений. В тестах система показала результаты в 10 раз лучше, чем GPT-5 — подробнее - HuggingFace

Подписывайтесь на Telegram EFEMERA: AI news.

2