Как юрфирмам структурировать базу знаний

Представьте M&A-юриста, который может подготовить первый черновик договора купли-продажи для клиентской сделки за 30 секунд - черновик, который уже учитывает term sheet сделки, требования клиента и все релевантные документы из прошлых сделок этого клиента.

Как юрфирмам структурировать базу знаний

Введение

За несколько десятилетий практики юрфирма с 50 и более юристами накапливает от десятков до сотен тысяч документов. В крупных международных фирмах с тысячами юристов счёт идёт на миллионы.

Сегодня весь этот массив материалов просто лежит в DMS, в почтовых ящиках юристов, на локальных компьютерах и так далее. Часть документов дублирует друг друга. Часть - это черновики соглашений и писем, которые так и не были финализированы и никогда не уходили клиенту. А часть - это просто случайный мусор: шаблоны, документы, не относящиеся к делу, файлы, оказавшиеся не в той папке.

Что мы имеем в виду под базой знаний юрфирмы (knowledge base)?

Это весь массив накопленных материалов, отражающий уникальное know-how фирмы. Сюда входит юридическая экспертиза в конкретных практиках (корпоративное право, трудовое право, антимонопольное право, capital markets и т.д.), понимание бизнеса каждого клиента и, пожалуй, самое ценное - годами накопленное умение выстраивать сложные сделки: что нужно сделать, в каком порядке и как, чтобы наилучшим образом защитить интересы клиента.

На практике сюда входят, среди прочего:

  1. финализированные, подписанные соглашения, письма, проспекты эмиссии, корпоративные решения, протоколы заседаний совета директоров;
  2. меморандумы, юридические заключения, отчёты и запросы due diligence, чек-листы к закрытию сделки;
  3. письма о намерениях (LOI), меморандумы о взаимопонимании;
  4. исковые заявления, отзывы на иски, апелляционные и кассационные жалобы, экспертные заключения;
  5. документы о соответствии регуляторным требованиям, переписка с регуляторами;
  6. шаблоны документов, заранее подготовленные фирмой;
  7. engagement letters, презентации для клиентов, клиентские алерты;
  8. содержательная переписка с клиентами и контрагентами по сделкам;
  9. любые другие документы, которые руководство фирмы считает важными.

Парадокс в том, что сама фирма зачастую точно не знает, что именно у неё есть в этом массиве материалов, потому что до сих пор не было практической необходимости всё это разбирать.

Зачем структурировать накопленные данные

Юрфирмы годами используют свои базы знаний: юрист находит релевантный прецедент, образец соглашения или меморандум и составляет новый документ на его основе. Но делают это не через случайный поиск по всему хранилищу - они полагаются на собственный опыт и интуицию: помнят, какой документ финальная версия, а какой черновик, какой прецедент сработал хорошо, а какой уже устарел.

Всё чаще эту роль вместо человека будет брать на себя AI-агент: запрашивать базу знаний, извлекать нужную информацию и использовать её для принятия решений по вопросу, поставленному юристом или другим AI-агентом.

Разница в том, что у AI-агента нет того опыта и интуиции, что есть у юриста. Он не может с одного взгляда определить, был ли прецедент проверен и одобрен партнёром или это заброшенный четырёхлетний черновик, или определить, какой из файлов - «SPA Goldman Stanley FINAL», «SPA Goldman Stanley FINAL FINAL» или «SPA Goldman Stanley FINAL FINAL 2» — на самом деле финальная версия.

Структурированная база знаний - это именно то, что подготавливает эти данные для использования AI-агентом в юридической работе фирмы.

Это особенно важно, учитывая масштаб проблемы: юристы уже тратят от 20% до 40% рабочего времени просто на поиск информации в существующих системах, и без структурирования и систематизации эта проблема не решается — она просто перекладывается на AI-агента, который быстрее, но будет так же слепо перебирать тот же самый хаос.

Что происходит без структурирования

Представьте AI-агента, который работает с базой знаний вместо человека, и база содержит миллионы документов без тегов. Столкнувшись с подобным запросом, retrieval-система физически не способна отличить прецедент, одобренный партнёром, от заброшенного черновика: для системы это просто два похожих текстовых фрагмента с высоким семантическим сходством. Различие, очевидное юристу, для системы просто не существует.

Вторая проблема - не только в качестве, но и в объёме. Без тегов система не может сузить поиск до горстки точных документов - вместо этого она поднимает широкий пласт всего, что показалось релевантным по смыслу или ключевым словам, и значительная часть этого пласта на практике окажется непригодной для конкретной задачи.

Возьмём конкретный пример. Юрист просит AI-агента: «Составь договор купли-продажи акций для брокера X в Казахстане, где наш клиент Goldman Stanley выступает продавцом». Дальше возможны два принципиально разных сценария.

Как юрфирмам структурировать базу знаний

Без структурирования. Агент запускает общий поиск по всей базе (ключевые слова плюс семантика). Он найдёт десятки документов про «договоры купли-продажи акций» и «Goldman Stanley», но среди них будут сделки, где Goldman Stanley выступал покупателем, а не продавцом, соглашения в другой отрасли или юрисдикции, и пятилетние черновики, которые так и не были подписаны. В итоге у агента получится пул в основном неподходящих документов, и новый документ будет составлен на основе именно этого пула.

Это не гипотетическая проблема. Согласно исследованию Stanford RegLab (Magesh, Surani, Dahl et al., 2024), ошибки на уровне retrieval - когда система находит документы, текстуально похожие, но по существу нерелевантные («naive retrieval»), или относящиеся не к той юрисдикции, суду или периоду времени («inapplicable authority») - являются основной причиной галлюцинаций в ведущих коммерческих legal AI продуктах (Lexis+ AI, Westlaw AI-Assisted Research, Practical Law AI).

Со структурированием. Агент ищет только среди документов, помеченных тегами:

practice = «corporate», jurisdiction = «Казахстан», document type = «agreement», agreement type = «share purchase agreement», industry = «financial services», deal party = «Goldman Stanley», client role = «seller».

В результате - горстка высоко релевантных прецедентов, полностью или частично удовлетворяющих заданным критериям. На основе этих прецедентов AI может сразу составить качественный новый документ.

Этапы работы

  1. Сведение документов из разных источников в одно место

Прежде чем что-либо фильтровать или тегировать, нужно физически собрать всё, что сейчас разбросано по разным системам, в одном месте:

  • репозиторий документов в DMS (iManage, NetDocuments или локальный аналог);
  • переписку и вложения из почтовых ящиков юристов;
  • файлы на локальных компьютерах;
  • архивные хранилища и резервные копии за прошлые годы, если фирма вообще их вела.

На практике главная сложность на этом этапе - не техническая, а организационная: фирме нужно решить, что именно считается «документом, достойным попадания в библиотеку базы знаний», а что - личным рабочим файлом, который не нужно переносить.

Но и техническая сторона не тривиальна. Документы приходят в разных форматах - PDF, DOCX, сканы, цепочки писем с вложениями - и прежде чем попасть в единый пул, их нужно распознать (OCR для сканов и фотографий), разобрать вложения и восстановить цепочки переписки (email threading), а затем разбить на фрагменты, пригодные для индексации и поиска.

Результат этого этапа - единый пул документов, с которым можно работать системно: фильтровать, дедуплицировать и тегировать.

2. Фильтрация и отбор полезных документов

После сведения в единый пул там будет много мусора: дубликаты, заброшенные черновики, случайные файлы. Задача на этом этапе - отделить документы с реальной ценностью от шума. Это совместная работа человека и AI-слоя фильтрации.

AI: использует векторный поиск для нахождения дубликатов и почти идентичных версий документов в рамках одного дела (например, пять версий одного и того же NDA), подсвечивает различия между ними и, на основе формальных признаков (блок подписи, корпоративные реквизиты, отслеживаемые изменения), определяет вероятный статус документа: финальный или черновик.

Человек: принимает финальное решение по каждому документу - оставить обе версии или исключить одну из них из структурированной базы знаний. Только юрист может оценить юридическую ценность каждой версии. Юрист также задаёт общие правила отбора для фирмы (например, стоит ли вообще хранить черновики) и разрешает пограничные случаи, которые AI не может классифицировать с достаточной уверенностью.

3. Метаданные и тегирование

Как юрфирмам структурировать базу знаний

Метаданные дела:

  • Номер дела
  • Дата открытия дела
  • Дата закрытия дела
  • Статус дела (активное / закрытое / приостановлено)

Теги дела:

  • Название клиента
  • Ответственный партнёр
  • Отрасль сделки: «финансовые услуги», «фарма», «IT» и т.д.
  • Юрисдикция (к какой стране или странам относится дело). Например, для листинга еврооблигаций казахстанской компании на Дублинской бирже юрисдикцией будут Казахстан и Ирландия.
  • Контрагент, тип контрагента, юрфирма контрагента
  • Финансовые параметры сделки (размер сделки)

Метаданные документа:

  • Номер дела
  • Название документа
  • Дата создания документа
  • Дата последнего изменения
  • Формат файла, размер файла и прочие технические данные
  • Количество версий документа
  • Автор документа
  • Последний, кто редактировал документ

Технические теги документа:

  • Статус документа: Черновик / Финальный / Подписан / Шаблон
  • Уровень конфиденциальности: конфиденциально / адвокатская тайна / не конфиденциально
  • Качество: рекомендован / одобрен партнёром / не проверен
  • Дата подписания, дата вступления в силу, срок действия
  • Язык документа
  • Связи с другими документами (с какими документами он связан)

Юридические теги документа:

  • Практика: корпоративное право, банковское право, антимонопольное право, интеллектуальная собственность и т.д.
  • Тип документа: у каждой практики свой набор типов документов. Для корпоративной практики, например: соглашение, письмо, меморандум, список запросов для DD, юридическое заключение и т.д.
  • Внутри каждого типа документа - классификация вариантов. Например, среди корпоративных соглашений: договор купли-продажи, акционерное соглашение и т.д.
  • Роль клиента: покупатель, продавец, кредитор, заёмщик, поручитель и т.д.
  • Применимое право
  • Место разрешения споров
  • Для каждого типа документа - содержательная информация, ценная сама по себе. Например, в проспекте эмиссии ценных бумаг это могут быть риск-факторы риска; в договоре купли-продажи долей - конкретные заверения.

Для тегирования фирмы могут использовать стандарт LMSS от SALI Alliance или другие стандарты. Эти стандарты дают готовую таксономию тегов, которую можно использовать для классификации юридических документов. К сожалению, в России нет отраслевого стандарта уровня LMSS/SALI. Юрфирма при желании может также разработать собственную внутреннюю таксономию.

Тегирование можно делать вручную или через AI. Второй вариант означает, что каждый документ вместе с классификатором передаётся AI с инструкцией вывести теги для документа в формате JSON.

4. Контроль доступа к документам (Ethical Walls)

Это отдельный вопрос, и один из самых сложных аспектов построения структурированной базы знаний.

Первый уровень - базовый: юрист не должен иметь возможности видеть документы, к которым у него нет доступа. Это давно является частью юридической этики и не имеет отношения к AI как таковому.

Второй уровень - специфичен именно для AI: даже если юрист не видит документ в интерфейсе, это не гарантирует, что AI не использует его «под капотом» при генерации ответа для этого юриста. Если retrieval-система индексирует все документы фирмы в едином пространстве, а доступ ограничен только на уровне интерфейса, агент технически может опираться на документ, к которому у юриста нет доступа. Юрист получит выглядящий корректно ответ и не будет знать, что для его генерации был использован конфиденциальный документ.

Поэтому контроль доступа должен быть встроен в сам индекс - система должна исключать документы за пределами периметра доступа юриста ещё до того, как они попадут в контекст модели.

Отдельная проблема - верифицируемость: даже при правильно настроенном контроле доступа фирме нужен способ доказать это постфактум (например, клиенту). Собственные внутренние логи фирмы не являются независимым доказательством.

Преимущества для юрфирмы

В итоге получается структурированная база знаний, полностью готовая к работе с AI-моделью. Имея доступ к базовой модели и правильно структурированной базе знаний, юрфирма может внедрить широкий спектр рабочих процессов:

  1. Составление соглашения (или другого документа) для текущей сделки клиента. Например, репозиторий DMS хранит все текущие документы по сделке, включая меморандум о взаимопонимание (MoU). При запросе составить договор купли-продажи долей AI будет иметь доступ к MoU, другим документам текущего дела и всем прошлым документам по этому и другим клиентам. Если, скажем, текущая сделка - приобретение аэропорта, а у конкретного клиента ещё не было подобных сделок, поиск по структурированной базе знаний поднимет прошлые договоры купли-продажи аэропортовых бизнесов в той же юрисдикции, заключённые для других клиентов, и встроит все нюансы, специфичные для этого типа бизнеса (в частности, конкретные гарантии, заверения, отлагательные условия и так далее).
  2. Интеграция с юридической базой данных (законодательство, судебная практика и т.д.) позволит AI-агенту проверять положения черновика соглашения на соответствие текущему законодательству и/или судебной практике.
  3. Due diligence - в M&A-сделке AI может быстро прогнать пул документов target компании по чек-листу и старым DD-отчётам, которые фирма использовала в похожих сделках (та же отрасль/юрисдикция), автоматически отмечая красные флаги, типичные для этого типа бизнеса.
  4. Регуляторный мониторинг - при изменении законодательства AI может найти все существующие подписанные клиентские документы, которые теперь могут быть устаревшими или требовать пересмотра.
  5. Анализ прошлых дел по похожим сделкам для оценки реалистичного бюджета и сроков новой сделки.

Помимо этих конкретных рабочих процессов, хорошо помеченная тегами база знаний даёт более фундаментальный эффект. AI начинает улавливать специфичные для клиента паттерны, которые прямо не прописаны ни в одном отдельном документе: этот клиент обычно настаивает на строгих условиях ответственности контрагента , но гибок по срокам закрытия сделки; предпочитает определённую формулировку применимого права или всегда выбирает конкретную площадку для третейского разбирательства.

Заключение

Фундаментальные модели становятся товаром массового потребления, доступ к ним есть у всех: у клиента, у конкурента, у legal tech стартапа. То же самое рано или поздно произойдёт и с самими AI-агентами: хорошие агентские инструменты станут рыночным стандартом, а не конкурентным преимуществом.

Но ни у одной модели и ни у одного вендора нет доступа к тому, что на самом деле отличает одну юрфирму от другой - к десятилетиям её собственной практики: как именно эта фирма вела сложные сделки, какие позиции она занимала для конкретных клиентов, что сработало в суде, а что нет, какие формулировки стали её фактическим стандартом. Это знание нельзя купить у вендора или получить из общедоступной модели - оно существует только внутри самой фирмы.

И есть ещё одно преимущество, которое легко упустить из виду. Структурированная база знаний - это фундамент, который позволяет юрфирме внедрять собственные инновации с контролем над данными и их качеством, независимо от того, какая базовая модель будет использоваться завтра.

Именно поэтому главным активом юрфирмы будущего станут не только сильные юристы, но и то, насколько хорошо структурирована и доступна для AI её накопленная база знаний. Скучная и скрупулезная работа по структурированию данных, о которой шла речь в этой статье, и есть работа по созданию этого актива. Крупные международные юрфирмы уже занимаются этим.

22