Подборка новых открытых моделей
✦ Krea Realtime 14B: видео модель
Поддерживает режимы Text-to-Video и Video-to-Video (вебка или видео на вход). Пользователь может менять промты в реальном времени, менять стиль и видеть результат сразу (задержка ~1 секунда). Генерация видео происходит со скоростью ~11 кадров в секунду на одной GPU NVIDIA B200. Построена модель на базе Wan 2.1 (14 млрд параметров)
✦ DeepSeek: OCR-модель для преобразования текстов
Модель преобразовывает документы в Markdown или текст. Распознаёт текста в изображениях и PDF, с поддержкой таблиц и сложных макетов. Умеет даже распознавать химические формулы. Имеет разные режимы работы для различных нужд пользователя. Поддерживает обработку низкокачественных картинок (от 512×512 до 1280×1280)
✦ PaddleOCR-VL от Baidu: мультимодальная модель
Эффективна для работы с документами: поддерживает 109 языков, текст, таблицы и графики. Небольшая модель на 0,9 млрд параметров, но превосходит GPT-4o, Gemini 2.5 в своих задачах. Система разметки PP-DocLayoutV2 помогает избежать галлюцинаций
Подписывайтесь на Telegram EFEMERA: AI news.