Учёные представили GOI, метод автоматического построения онтологий из документов

Онтологический инжиниринг, построение явных схем классов, свойств и связей предметной области, остаётся узким местом для ИИ-систем, интенсивно работающих со знаниями. Существующие автоматизированные подходы к построению онтологий либо опираются на заранее заданную схему, либо работают только в узкой предметной области, либо выдают неструктурированный результат, непригодный для использования в последующих программных конвейерах.

Авторы представили метод Generative Ontology Induction (GOI, «генеративное индуцирование онтологий»), не привязанный к конкретному домену. GOI строит «генеративный чертёж» предметной области: сущности (классы), измерения, свойства, отношения и ограничения, на основе корпуса примеров документов. Результат экспортируется как типизированный граф с шестью типами узлов и семью типами рёбер в форматах YAML или JSON.

Отдельно авторы предложили новую метрику, оценку покрытия узлов (Node Coverage Score): она измеряет, какая доля структурных узлов онтологии (классов, свойств, измерений) действительно появляется в текстах, которые LLM сгенерировала по построенной схеме.

Метод проверили на четырёх контрастных онтологиях: типовой схеме счёта за программные услуги (Software Services Invoice), самостоятельно составленной онтологии описания вакансии (Job Description Ontology), конфиденциальной онтологии записи клинического визита по обезболивающей терапии (Pain-Management Clinical Visit Record Ontology) и онтологии договора на профессиональные услуги и техзадания (Professional Services Contract & Statement of Work Ontology).

Генерация по подсказкам GOI во всех четырёх случаях покрыла 95, 100% структурного «костяка» онтологии. Для сравнения, обычный шаблон из трёх общих полей без GOI дал 97,8% покрытия на схеме счёта, домене, хорошо знакомом модели, но упал до 52,2% на онтологии вакансий, 62,2% на онтологии обезболивающей терапии и 78,3% на онтологии договора об услугах. Авторы подчёркивают: структурное покрытие у GOI держится стабильно независимо от того, насколько тип документа знаком модели заранее, то есть метод действительно извлекает структуру из поданного корпуса примеров, а не полагается на память модели о конкретном домене.

Ключевые факты

  • GOI (Generative Ontology Induction) строит из корпуса примеров документов «генеративный чертёж» домена, сущности, измерения, свойства, отношения и ограничения, и экспортирует его как типизированный граф (6 типов узлов, 7 типов рёбер) в YAML/JSON
  • Предложена новая метрика Node Coverage Score, доля структурных узлов онтологии (классов, свойств, измерений), реально появляющихся в сгенерированном по схеме тексте
  • Метод проверен на четырёх онтологиях: счёт за программные услуги, описание вакансии, клиническая запись по обезболивающей терапии, договор на профуслуги
  • GOI покрывает 95, 100% структуры онтологии во всех четырёх случаях
  • Простой шаблон из трёх полей без GOI даёт 97,8% только на знакомом модели домене счетов, но падает до 52,2, 78,3% на трёх остальных онтологиях, покрытие GOI от этого не зависит

Почему это важно

Построение онтологии, то есть явной схемы классов, свойств и связей предметной области, сегодня либо делают вручную, либо автоматизируют инструментами, которые работают только в узком домене или требуют заранее заданной структуры. GOI предлагает домен-агностичный способ вывести такую схему прямо из корпуса примеров документов и заодно даёт метрику (Node Coverage Score), которой можно объективно измерять, насколько полно генерация покрывает нужную структуру, а не оценивать результат на глаз.

Кому это важно

Работа адресована инженерам знаний и командам, которые строят системы структурирования документов, извлечения данных, RAG или графы знаний для специфических доменов, юридического, медицинского, HR, финансового, где готовых онтологий нет и размечать схему вручную дорого. Также полезна исследователям, которым нужен объективный способ измерять полноту автоматически сгенерированной структурированной схемы.

Как это применить

На вход GOI подаётся корпус примеров документов домена; метод индуцирует из него типизированный граф онтологии (сущности, измерения, свойства, отношения, ограничения) и сохраняет его в YAML или JSON, готовым для использования в последующих программных конвейерах, валидации данных, извлечения информации, генерации структурированных документов по схеме. Node Coverage Score можно использовать отдельно как метрику для оценки любых других подходов к автоматическому построению или заполнению онтологий.

Можно ли доверять

Это препринт на arXiv, статья описывает собственную контролируемую валидацию авторов на четырёх онтологиях, одна из которых названа «конфиденциальной», то есть независимо проверить исходные данные по ней нельзя. Сравнение приведено с одним слабым базовым вариантом (шаблон из трёх общих полей), а не с другими опубликованными методами автоматического построения онтологий, что ограничивает силу вывода о превосходстве GOI.

Риски и подводные камни

Валидация охватывает всего четыре предметные области, обобщение метода на существенно более широкий круг доменов пока не подтверждено. Базовая линия для сравнения намеренно упрощённая (три общих поля), поэтому разрыв в покрытии может отражать слабость baseline, а не исключительную силу GOI. Node Coverage Score измеряет только присутствие структурных узлов, но не проверяет смысловую корректность или качество заполненного содержания, высокое покрытие не гарантирует, что сгенерированные данные фактически верны.