Thomson Reuters вложила 40 млн долларов в собственную ИИ-модель, чтобы меньше платить чужим разработчикам
Международная информационная компания Thomson Reuters, владеющая агентством Reuters и крупными юридическими базами, создала языковую модель Thomson для профессиональной работы. Проект обошёлся примерно в 40 млн долларов. Компания рассчитывает сократить расходы на внешние ИИ-сервисы и получить контроль над тем, какие задачи и данные станут приоритетом для модели.
Thomson не обучали с нуля. Её текущая основа — Snowdon, промежуточная модель, которую совместная лаборатория Thomson Reuters и Imperial College London создала на базе открытой Qwen от китайской компании Alibaba. Затем систему дополнительно обучали на собственных материалах и на примерах, подготовленных профильными экспертами.
Главный актив здесь не архитектура, а архив. У Thomson Reuters накопилось 175 лет юридических, налоговых, бухгалтерских и новостных материалов. Для обучения использовали документы из Westlaw, Practical Law, Checkpoint и Reuters, причём пока в работу пошло менее 10% доступного контента.
Заявленные 40 млн долларов включают зарплаты команды и вычисления за 2 года, а не только один финальный запуск обучения. Для большинства компаний такая сумма недоступна. Но у владельца массового профессионального сервиса расчёт другой: собственная модель может многократно выполнять дорогую обработку документов без оплаты каждого запроса стороннему поставщику.
Thomson Reuters утверждает, что Thomson конкурирует с крупнейшими универсальными моделями и выигрывает в отдельных юридических тестах, включая проверку качества ссылок на источники. Однако основные сравнительные результаты опубликованы самой компанией, а независимая академическая оценка ещё продолжается. На части открытых тестов другие модели остаются сильнее.
Первым рабочим местом Thomson станет функция Tabular Analysis в юридическом помощнике CoCounsel Legal. Она проверяет до 10 000 документов по 100 вопросам и показывает источник для каждого ответа. Это узкая повторяющаяся задача, где даже небольшое снижение стоимости одного запроса превращается в заметную экономию.
При этом Thomson Reuters не отказывается от чужих моделей. CoCounsel Legal остаётся мультимодельным продуктом, а значительную часть его функций по-прежнему обслуживает Claude от Anthropic. Собственная система будет постепенно забирать те операции, где внутренние данные и большой объём запросов дают ей экономическое преимущество.
Этот кейс показывает границу между арендой и владением ИИ. Создавать свою модель имеет смысл не любой крупной компании, а организации с уникальным массивом качественных данных, экспертами для проверки результатов и постоянным потоком однотипных дорогих задач. Без этих трёх условий открытая основа сама по себе не превращается в выгодный продукт.