WordLift випустила аналізатор, який не вгадує, коли даних мало

Дата публікації: 18.09.2026
Коротко
  • WordLift випустила Content Analysis v3, яка перетворює текст на стабільні ідентифікатори сутностей у Wikidata для восьми мов.
  • Система утримується від відповіді, коли доказів мало, замість того щоб вгадувати.
  • На власних тестових наборах вона вже набирає більше за Google Cloud Natural Language для німецької, англійської та іспанської, а де помиляється, компанія пише сама.

Компанія, яка п'ятнадцять років тому починала з проєктів IKS та Apache Stanbol, вважає, що розпізнавання сутностей стає базовою інфраструктурою для ШІ. Тому WordLift виклала третю версію Content Analysis і розповіла, як вона працює, що виміряла й де досі помиляється. Оригінал відкрити не вдалося (сайт віддав 403), тому нижче спираюся на анонс матеріалу.

Від слова до постійного ідентифікатора

Ідея проста для пояснення й складна для реалізації. Слово «Apple» у тексті може бути фруктом, компанією чи прізвищем. Розпізнавання сутностей — це вибір правильного значення й прив'язка його до стабільного запису, у цьому разі до Wikidata, де в кожного об'єкта є постійний номер. Content Analysis v3 робить це для восьми мов і повертає набір ідентичностей, на які можуть посилатися інші системи, замість плоского списку слів.

Розробники вважають цю задачу таким самим фундаментом для ШІ, яким колись була семантична розмітка для вебу. Пошукові системи й генеративні моделі спираються на сутності, коли вирішують, про що сторінка й кому довіряти. Тому власнику сайту корисно знати, які сутності з його тексту машина бачить, а які губить. Практичний спосіб це перевірити ми описували в чек-листі аудиту ШІ-сліду сутностей.

Система, що вміє відмовитися

Найцікавіша деталь анонсу — утримання від відповіді. Коли доказів у тексті мало, v3 залишає сутність нерозпізнаною й нічого не підставляє навмання. Для аналітика це різниця між хибним посиланням, яке потім тихо псує дані, і чесним пропуском, який видно. У задачах, де результат вантажиться в граф знань, така поведінка цінніша за пару зайвих відсотків повноти.

Що заявленоДеталь
ІдентифікаториСтабільні записи Wikidata
МовиВісім
ПорівнянняВище за Google Cloud Natural Language для німецької, англійської й іспанської на власних наборах WordLift
Слабкі місцяКомпанія окремо описує, де система помиляється

Чому до цих цифр варто ставитись обережно

Порівняння зроблено на власних тестових наборах компанії, незалежного бенчмарка тут немає. Перемога над Google Cloud Natural Language у трьох мовах з восьми означає, що для решти п'яти такого твердження немає. Для нашого ринку питання гостріше: чи входить українська до цих восьми мов, з анонсу не видно, а локальні компанії й магазини у Wikidata зазвичай представлені слабко. Якщо запису в базі немає, навіть найкращому інструменту нема з чим зіставляти.

Із цього виходить простий практичний висновок про роботу з даними. Реєстрація бренду й ключових продуктів у Wikidata, а також послідовна схема Organization на сайті — те, що допомагає будь-якому розпізнавачу, чи це WordLift, чи Google. Про базу такого підходу є матеріал про єдине джерело правди для ШІ.

Мене більше за самі відсотки зацікавило, що компанія сама розповідає про власні збої. Такий тон у SEO-інструментів трапляється рідко, і цікаво, чи хтось із конкурентів відповість тим самим.

Редакція SEO Factory

Редакція SEO Factory щодня переглядає першоджерела — блог Google Search Central, Search Engine Land, Search Engine Journal та інші галузеві видання — і відбирає те, що впливає на роботу українського бізнесу в пошуку та рекламі.

Кожну новину звіряємо з оригіналом і доповнюємо висновком: що саме змінилося і що з цим робити власнику сайту чи маркетологу.