← Блог

Размытая середина: почему рядом с любым процентом совместимости должна стоять погрешность

Процент совместимости — это оценка, а не измерение. Разбираем, как погрешность измерения, ретестовая надёжность и ошибка модели делают 78 и 82 одним и тем же результатом.

Перед вами две анкеты. В одной написано 82% совместимости. В другой — 78%. Кому напишете первым?

Почти все выбирают 82. И почти все принимают решение на основе шума.

Разрыв в четыре пункта кажется информацией, потому что он подан как число, а числа несут в себе негласное обещание: то, что считают, достаточно устойчиво, чтобы его считать. Ваш рост — 178 см. Остаток на счёте — 1240,17 $. Процент совместимости выглядит родственником этих величин. Он им не является. Он из другой, куда более неряшливой семьи — оценок, выведенных из других оценок, каждая из которых подрагивает.

Это не аргумент в пользу того, что проценты совместимости бесполезны. Это аргумент в пользу того, что число без погрешности — недописанная фраза. Ниже — как её дописать.

Откуда на самом деле берётся число

Любой процент совместимости, включая наш, — конец цепочки:

  1. Вы отвечаете на пункты теста. Может, на 50, может, на 300. Каждый — зашумлённый косвенный признак чего-то глубинного.
  2. Пункты превращаются в баллы по чертам. Доброжелательность, тревожность привязанности, избегание конфликта, тяга к новизне — каждая черта есть взвешенное среднее пунктов и наследует ошибку своих слагаемых.
  3. Профили черт двух людей сопоставляются. По одним измерениям важно сходство, по другим — взаимодополнение, сверху — фильтры по стоп-факторам.
  4. Сопоставление схлопывается в одно число. Обычно отмасштабированное так, чтобы выглядеть процентом, — проценты вызывают доверие.

Четыре преобразования. Ошибка входит на каждом и уже не уходит. К четвёртому шагу система приняла около дюжины модельных решений — какие черты важны, насколько, где хорошо сходство, а где различие, — и формат вывода прячет их все за двумя цифрами.

Надёжность: число, которое стоило бы печатать рядом с каждым процентом

Базовая идея психометрики почти неловко проста. Любой наблюдаемый балл — это истинный балл плюс ошибка. Вопрос в том, какая часть различий между людьми является сигналом, а какая — болтанкой.

Ретестовая надёжность отвечает на это прямо: дайте одним и тем же людям один и тот же инструмент дважды и посмотрите, насколько коррелируют два набора результатов. У хорошо сделанных личностных опросников она обычно приличная, но никогда не идеальная — и, что принципиально, зависит от того, кого вы тестируете. Один анализ Big Five Inventory показал медианную ретестовую надёжность .66 на социодемографически разнородной выборке взрослых — заметно ниже медианы .78, которую обычно получают на студенческих выборках. Тот же опросник. Другие люди. Существенно иная устойчивость.

Этот разрыв важен, потому что почти весь потребительский мэтчинг работает с разнородными взрослыми, тогда как значительная часть валидационной литературы построена на студентах.

Из надёжности выводится стандартная ошибка измерения — ожидаемый разброс наблюдаемых баллов человека вокруг его истинного балла; она равна стандартному отклонению, умноженному на корень из (единица минус надёжность).

Проделаем эту арифметику на правдоподобном проценте совместимости. Это иллюстрация, а не опубликованный результат: допустим, баллы по вашему пулу кандидатов имеют стандартное отклонение 12 пунктов, а у составного показателя надёжность .80 — щедрая оценка для конструкта, надстроенного над несколькими оценками черт.

  • Стандартная ошибка измерения ≈ 12 × √0,20 ≈ 5,4 пункта
  • 95-процентный интервал вокруг одного балла ≈ ±10,5 пункта

То есть ваши 82 — это на самом деле «где-то между 71 и 93». А 78 — «где-то между 67 и 89». Эти интервалы перекрываются почти на всей длине. 82 и 78 — для любых практических целей один и тот же результат.

При сравнении двух баллов требования ещё жёстче. Ошибка разности двух независимо измеренных баллов больше, чем ошибка каждого из них, — примерно в √2 раза, около 7,6 пункта в нашем примере. Чтобы разрыв прошёл 95-процентный порог, он должен составлять около 15 пунктов. При таких допущениях 70 против 86 — реальное различие, на которое стоит реагировать. А 78 против 82 — подбрасывание монетки в белом халате.

Разностные баллы — самая шаткая деталь механизма

Вот часть, которая редко попадает в продуктовые тексты. Расчёт совместимости часто опирается на показатели разности или сходства: насколько далеко два человека разведены по добросовестности, насколько совпадают их стили разрешения конфликтов. В психометрике давно известно: разностные баллы наследуют ошибку обоих компонентов, при этом нередко вычитая ту общую дисперсию, благодаря которой каждый компонент и был надёжен. Разрыв между двумя умеренно надёжными измерениями заслуживает меньше доверия, чем любое из них по отдельности.

А значит, те части матчинговой модели, которые кажутся самыми интуитивно понятными — «вы оба высоки по открытости!», — часто собраны из самых неустойчивых величин в системе. Мы уже писали о том, что доказательная база на самом деле говорит про сходство и взаимодополнение; проблема измерения лежит под этим спором и ограничивает, насколько уверенно можно дать любой ответ.

Добавьте то, что люди отвечают неискренне неодинаково — социально желательные ответы смещают баллы, а не просто рассеивают их, — и вы получите смещение поверх дисперсии. Шум можно усреднить. Смещение — нет.

Пороги превращают маленький шум в большие переключения

Всё сказанное касается непрерывных баллов. С категориальными выводами хуже: любая отсечка превращает крошечное дрожание измерения в полную смену ярлыка.

Типологические традиции иллюстрируют это выпукло. Разбирая доказательную базу вокруг Myers-Briggs, психолог Стивен Беннинг отмечал, что «более трети людей получают другой четырёхбуквенный тип спустя четыре недели». Их личности не переродились за месяц. Они просто стояли у границы дихотомии, и случайная погрешность измерения перетолкнула их через неё.

Любая матчинговая система, выдающая уровни — «отличное совпадение», «хорошее совпадение», — заново создаёт ровно этот обрыв. Человек с 79,4 и человек с 80,1 получают категориально разное обращение из-за разрыва, который меньше погрешности вокруг каждого из них. Диапазоны — это нормально; выдавать границы диапазонов за реальность — нет.

Даже идеальное измерение не спасло бы процент

Допустим, вы полностью устранили погрешность измерения. Вы всё равно упрётесь в потолок: насколько вообще романтический исход предсказуем по самоотчёту, собранному до встречи.

Данные здесь отрезвляющие, и их стоит усвоить. В известном исследовании быстрых свиданий, где к первичному влечению применили машинное обучение, выяснилось: модель может предсказать, кто склонен нравиться и кто склонен увлекаться, — но не конкретное, уникальное влечение одного определённого человека к другому.[1] Общие тенденции оказались выучиваемыми. Химия между конкретной парой — нет.

Позднее исследователи объединили 43 диадических лонгитюдных набора данных из 29 лабораторий. Переменные, специфичные для отношений, — воспринимаемая вовлечённость партнёра, благодарность, сексуальная удовлетворённость — объясняли до 45% дисперсии качества отношений на старте и до 18% в конце исследования, тогда как индивидуальные различия — 21% и 12% соответственно. Примечательно, что собственные отчёты человека имели куда больший предсказательный вес, чем отчёты его партнёра.

Прочитайте это внимательно, потому что это главное ограничение для всей отрасли: самые сильные предикторы — это свойства отношений, которых ещё не существует. Пока два человека не встретились, нельзя измерить ни благодарность, ни воспринимаемую вовлечённость. Можно измерить только более слабые индивидуальные характеристики.

Именно поэтому в своём всестороннем обзоре онлайн-дейтинга Финкель с коллегами заключили: нет убедительных свидетельств в пользу заявлений матчинговых сервисов о том, что их математические алгоритмы дают романтические результаты лучше, чем другие способы сводить людей.[2] Социолог Майкл Розенфельд высказался о таких алгоритмах резче: по его словам, это «в основном дым и зеркала».[3]

Число, объясняющее скромную долю дисперсии, всё равно может быть полезным — оно лучше, чем географическая близость и одна фотография. Но подавать его надо тем, что оно есть: априорной оценкой, а не пророчеством.

Как выглядит честная система совместимости

Если принять всё вышесказанное, из этого следует несколько проектных выводов, и мы их придерживаемся:

  • Показывать диапазон, а не точку. «Вероятно, в районе 70+» правдивее, чем «78».
  • Сообщать уверенность отдельно от балла. Двадцать отвеченных пунктов не должны выглядеть так же авторитетно, как двести. Малоинформативные совпадения должны выглядеть малоинформативными.
  • Предпочитать ранг величине. «Верхний дециль вашего пула» переживает погрешность измерения лучше, чем двузначный процент: порядок устойчивее, чем расстояния.
  • Отказываться различать внутри шума. Если два кандидата попадают в один доверительный коридор, показывайте их как равных. Навязанное ранжирование, которое нельзя обосновать, — это маленькая ложь, повторённая тысячи раз.
  • Показывать драйверы. Какие три входных параметра сдвинули этот балл и в какую сторону? С баллом, который можно проверить, можно и спорить.
  • Говорить, что его изменит. «Пройдите модуль про конфликты — и оценка станет примерно вдвое точнее» честнее любого знака после запятой.

Мы скорее скажем вам, что совпадение неопределённое, чем сфабрикуем точность, которую не можем защитить. Поэтому же разговаривают аватары: диалог вытаскивает тот самый специфичный для отношений сигнал, до которого не дотягивается ни один предварительный опросник. Балл сужает поле; разговор его проверяет.

Полевой справочник: шесть вопросов к любому показанному вам баллу

Задавайте их и нам тоже.

  1. Какова надёжность инструмента, лежащего в основе, и на ком она установлена?
  2. Сколько пунктов дали этот результат и как давно на них отвечали?
  3. Сопоставим ли этот балл между людьми — или это ранг внутри вашего пула, переодетый процентом?
  4. Какую минимальную разницу система считает значимой? Если ответа нет — она этого не знает.
  5. Какие входные данные сдвинули балл сильнее всего — и совпадает ли это с моим собственным ощущением важного?
  6. Проверялось ли хоть что-то в этой системе на реальных исходах отношений — или только на самоотчётной удовлетворённости экраном с результатом?

Если продукт не может ответить на большинство из них, число — декорация.

Размытая середина — это место, где вы и живёте

Вот то, что вслух обычно не произносят: для большинства пользователей бо́льшую часть времени подавляющая часть кандидатов находится в неразличимой полосе. Несколько человек явно не подходят — стоп-факторы сталкиваются, ценности расходятся жёстко. Несколько выглядят по-настоящему многообещающе. Все остальные — в размытой середине, и размытая середина не провал алгоритма. Это честная форма данных.

Балл хорош для сортировки: отсечь очевидно неподходящих, вывести на поверхность правдоподобно подходящих, избавить вас от перебора вживую. Чем он плох — так это выбором между 78 и 82.

Так что относитесь к числу как к прогнозу погоды. Семьдесят процентов вероятности дождя — полезно, это повод взять куртку. Но это не значит, что сегодня мокрее, чем при вчерашних шестидесяти восьми. Пройдите тесты, прочитайте диапазон — и идите вести тот разговор, на который число может только намекнуть.

Самое достойное доверия, что может сообщить вам матчинговая система, — это не то, насколько вы совместимы. А то, насколько она в этом уверена.

Источники

  1. Dating? A magic formula to predict attraction is more elusive than ever — ScienceDaily
  2. Online Dating: A Critical Analysis From the Perspective of Psychological Science — Psychological Science in the Public Interest
  3. Critics challenge the 'science' behind online dating — San Francisco Chronicle

Поделиться статьёй

← Все статьи

Комментарии

Комментариев пока нет — будьте первым.