В корзине пусто!
WordLift выпустила анализатор, который не гадает, когда данных мало

- WordLift выпустила Content Analysis v3, которая превращает текст в стабильные идентификаторы сущностей в Wikidata для восьми языков.
- Система воздерживается от ответа, когда доказательств мало, вместо того чтобы угадывать.
- На собственных тестовых наборах она уже набирает больше Google Cloud Natural Language для немецкого, английского и испанского, а где ошибается, компания пишет сама.
Компания, которая пятнадцать лет назад начинала с проектов IKS и Apache Stanbol, считает, что распознавание сущностей становится базовой инфраструктурой для ИИ. Поэтому WordLift выложила третью версию Content Analysis и рассказала, как она работает, что измерила и где до сих пор ошибается. Оригинал мне открыть не удалось (сайт отдал 403), поэтому ниже опираюсь на анонс материала.
От слова к постоянному идентификатору
Идея проста для объяснения и сложна в реализации. Слово «Apple» в тексте может быть фруктом, компанией или фамилией. Распознавание сущностей — это выбор правильного значения и привязка его к стабильной записи, в данном случае к Wikidata, где у каждого объекта есть постоянный номер. Content Analysis v3 делает это для восьми языков и возвращает набор идентичностей, на которые могут ссылаться другие системы, вместо плоского списка слов.
Разработчики считают эту задачу таким же фундаментом для ИИ, каким когда-то была семантическая разметка для веба. Поисковые системы и генеративные модели опираются на сущности, когда решают, о чём страница и кому доверять. Поэтому владельцу сайта полезно знать, какие сущности из его текста машина видит, а какие теряет. Практический способ это проверить мы описывали в чек-листе аудита ИИ-следа сущностей.
Система, которая умеет отказаться
Самая интересная деталь анонса — воздержание от ответа. Когда доказательств в тексте мало, v3 оставляет сущность нераспознанной и ничего не подставляет наугад. Для аналитика это разница между ложной ссылкой, которая потом тихо портит данные, и честным пропуском, который виден. В задачах, где результат грузится в граф знаний, такое поведение ценнее пары лишних процентов полноты.
| Что заявлено | Деталь |
|---|---|
| Идентификаторы | Стабильные записи Wikidata |
| Языки | Восемь |
| Сравнение | Выше Google Cloud Natural Language для немецкого, английского и испанского на собственных наборах WordLift |
| Слабые места | Компания отдельно описывает, где система ошибается |
Почему к этим цифрам стоит относиться осторожно
Сравнение сделано на собственных тестовых наборах компании, независимого бенчмарка здесь нет. Победа над Google Cloud Natural Language в трёх языках из восьми означает, что для остальных пяти такого утверждения нет. Для нашего рынка вопрос острее: входит ли украинский в эти восемь языков, из анонса не видно, а локальные компании и магазины в Wikidata обычно представлены слабо. Если записи в базе нет, даже лучшему инструменту не с чем сопоставлять.
Отсюда простой практический вывод о работе с данными. Регистрация бренда и ключевых продуктов в Wikidata, а также последовательная схема Organization на сайте помогают любому распознавателю, будь то WordLift или Google. О базе такого подхода есть материал про единый источник правды для ИИ.
Меня больше самих процентов заинтересовало, что компания сама рассказывает о собственных сбоях. Такой тон у SEO-инструментов встречается редко, и любопытно, ответит ли кто-то из конкурентов тем же.


