Подборка новых открытых моделей

✦ Krea Realtime 14B: видео модель

Поддерживает режимы Text-to-Video и Video-to-Video (вебка или видео на вход). Пользователь может менять промты в реальном времени, менять стиль и видеть результат сразу (задержка ~1 секунда). Генерация видео происходит со скоростью ~11 кадров в секунду на одной GPU NVIDIA B200. Построена модель на базе Wan 2.1 (14 млрд параметров)

✦ DeepSeek: OCR-модель для преобразования текстов

Модель преобразовывает документы в Markdown или текст. Распознаёт текста в изображениях и PDF, с поддержкой таблиц и сложных макетов. Умеет даже распознавать химические формулы. Имеет разные режимы работы для различных нужд пользователя. Поддерживает обработку низкокачественных картинок (от 512×512 до 1280×1280)

✦ PaddleOCR-VL от Baidu: мультимодальная модель

Эффективна для работы с документами: поддерживает 109 языков, текст, таблицы и графики. Небольшая модель на 0,9 млрд параметров, но превосходит GPT-4o, Gemini 2.5 в своих задачах. Система разметки PP-DocLayoutV2 помогает избежать галлюцинаций

HF - GitHub - Тех.отчёт, демо: HF - MS

Подписывайтесь на Telegram EFEMERA: AI news.

1