Размытая середина: почему рядом с любым процентом совместимости должна стоять погрешность
Процент совместимости — это оценка, а не измерение. Разбираем, как погрешность измерения, ретестовая надёжность и ошибка модели делают 78 и 82 одним и тем же результатом.
Перед вами две анкеты. В одной написано 82% совместимости. В другой — 78%. Кому напишете первым?
Почти все выбирают 82. И почти все принимают решение на основе шума.
Разрыв в четыре пункта кажется информацией, потому что он подан как число, а числа несут в себе негласное обещание: то, что считают, достаточно устойчиво, чтобы его считать. Ваш рост — 178 см. Остаток на счёте — 1240,17 $. Процент совместимости выглядит родственником этих величин. Он им не является. Он из другой, куда более неряшливой семьи — оценок, выведенных из других оценок, каждая из которых подрагивает.
Это не аргумент в пользу того, что проценты совместимости бесполезны. Это аргумент в пользу того, что число без погрешности — недописанная фраза. Ниже — как её дописать.
Откуда на самом деле берётся число
Любой процент совместимости, включая наш, — конец цепочки:
- Вы отвечаете на пункты теста. Может, на 50, может, на 300. Каждый — зашумлённый косвенный признак чего-то глубинного.
- Пункты превращаются в баллы по чертам. Доброжелательность, тревожность привязанности, избегание конфликта, тяга к новизне — каждая черта есть взвешенное среднее пунктов и наследует ошибку своих слагаемых.
- Профили черт двух людей сопоставляются. По одним измерениям важно сходство, по другим — взаимодополнение, сверху — фильтры по стоп-факторам.
- Сопоставление схлопывается в одно число. Обычно отмасштабированное так, чтобы выглядеть процентом, — проценты вызывают доверие.
Четыре преобразования. Ошибка входит на каждом и уже не уходит. К четвёртому шагу система приняла около дюжины модельных решений — какие черты важны, насколько, где хорошо сходство, а где различие, — и формат вывода прячет их все за двумя цифрами.
Надёжность: число, которое стоило бы печатать рядом с каждым процентом
Базовая идея психометрики почти неловко проста. Любой наблюдаемый балл — это истинный балл плюс ошибка. Вопрос в том, какая часть различий между людьми является сигналом, а какая — болтанкой.
Ретестовая надёжность отвечает на это прямо: дайте одним и тем же людям один и тот же инструмент дважды и посмотрите, насколько коррелируют два набора результатов. У хорошо сделанных личностных опросников она обычно приличная, но никогда не идеальная — и, что принципиально, зависит от того, кого вы тестируете. Один анализ Big Five Inventory показал медианную ретестовую надёжность .66 на социодемографически разнородной выборке взрослых — заметно ниже медианы .78, которую обычно получают на студенческих выборках. Тот же опросник. Другие люди. Существенно иная устойчивость.
Этот разрыв важен, потому что почти весь потребительский мэтчинг работает с разнородными взрослыми, тогда как значительная часть валидационной литературы построена на студентах.
Из надёжности выводится стандартная ошибка измерения — ожидаемый разброс наблюдаемых баллов человека вокруг его истинного балла; она равна стандартному отклонению, умноженному на корень из (единица минус надёжность).
Проделаем эту арифметику на правдоподобном проценте совместимости. Это иллюстрация, а не опубликованный результат: допустим, баллы по вашему пулу кандидатов имеют стандартное отклонение 12 пунктов, а у составного показателя надёжность .80 — щедрая оценка для конструкта, надстроенного над несколькими оценками черт.
- Стандартная ошибка измерения ≈ 12 × √0,20 ≈ 5,4 пункта
- 95-процентный интервал вокруг одного балла ≈ ±10,5 пункта
То есть ваши 82 — это на самом деле «где-то между 71 и 93». А 78 — «где-то между 67 и 89». Эти интервалы перекрываются почти на всей длине. 82 и 78 — для любых практических целей один и тот же результат.
При сравнении двух баллов требования ещё жёстче. Ошибка разности двух независимо измеренных баллов больше, чем ошибка каждого из них, — примерно в √2 раза, около 7,6 пункта в нашем примере. Чтобы разрыв прошёл 95-процентный порог, он должен составлять около 15 пунктов. При таких допущениях 70 против 86 — реальное различие, на которое стоит реагировать. А 78 против 82 — подбрасывание монетки в белом халате.
Разностные баллы — самая шаткая деталь механизма
Вот часть, которая редко попадает в продуктовые тексты. Расчёт совместимости часто опирается на показатели разности или сходства: насколько далеко два человека разведены по добросовестности, насколько совпадают их стили разрешения конфликтов. В психометрике давно известно: разностные баллы наследуют ошибку обоих компонентов, при этом нередко вычитая ту общую дисперсию, благодаря которой каждый компонент и был надёжен. Разрыв между двумя умеренно надёжными измерениями заслуживает меньше доверия, чем любое из них по отдельности.
А значит, те части матчинговой модели, которые кажутся самыми интуитивно понятными — «вы оба высоки по открытости!», — часто собраны из самых неустойчивых величин в системе. Мы уже писали о том, что доказательная база на самом деле говорит про сходство и взаимодополнение; проблема измерения лежит под этим спором и ограничивает, насколько уверенно можно дать любой ответ.
Добавьте то, что люди отвечают неискренне неодинаково — социально желательные ответы смещают баллы, а не просто рассеивают их, — и вы получите смещение поверх дисперсии. Шум можно усреднить. Смещение — нет.
Пороги превращают маленький шум в большие переключения
Всё сказанное касается непрерывных баллов. С категориальными выводами хуже: любая отсечка превращает крошечное дрожание измерения в полную смену ярлыка.
Типологические традиции иллюстрируют это выпукло. Разбирая доказательную базу вокруг Myers-Briggs, психолог Стивен Беннинг отмечал, что «более трети людей получают другой четырёхбуквенный тип спустя четыре недели». Их личности не переродились за месяц. Они просто стояли у границы дихотомии, и случайная погрешность измерения перетолкнула их через неё.
Любая матчинговая система, выдающая уровни — «отличное совпадение», «хорошее совпадение», — заново создаёт ровно этот обрыв. Человек с 79,4 и человек с 80,1 получают категориально разное обращение из-за разрыва, который меньше погрешности вокруг каждого из них. Диапазоны — это нормально; выдавать границы диапазонов за реальность — нет.
Даже идеальное измерение не спасло бы процент
Допустим, вы полностью устранили погрешность измерения. Вы всё равно упрётесь в потолок: насколько вообще романтический исход предсказуем по самоотчёту, собранному до встречи.
Данные здесь отрезвляющие, и их стоит усвоить. В известном исследовании быстрых свиданий, где к первичному влечению применили машинное обучение, выяснилось: модель может предсказать, кто склонен нравиться и кто склонен увлекаться, — но не конкретное, уникальное влечение одного определённого человека к другому.[1] Общие тенденции оказались выучиваемыми. Химия между конкретной парой — нет.
Позднее исследователи объединили 43 диадических лонгитюдных набора данных из 29 лабораторий. Переменные, специфичные для отношений, — воспринимаемая вовлечённость партнёра, благодарность, сексуальная удовлетворённость — объясняли до 45% дисперсии качества отношений на старте и до 18% в конце исследования, тогда как индивидуальные различия — 21% и 12% соответственно. Примечательно, что собственные отчёты человека имели куда больший предсказательный вес, чем отчёты его партнёра.
Прочитайте это внимательно, потому что это главное ограничение для всей отрасли: самые сильные предикторы — это свойства отношений, которых ещё не существует. Пока два человека не встретились, нельзя измерить ни благодарность, ни воспринимаемую вовлечённость. Можно измерить только более слабые индивидуальные характеристики.
Именно поэтому в своём всестороннем обзоре онлайн-дейтинга Финкель с коллегами заключили: нет убедительных свидетельств в пользу заявлений матчинговых сервисов о том, что их математические алгоритмы дают романтические результаты лучше, чем другие способы сводить людей.[2] Социолог Майкл Розенфельд высказался о таких алгоритмах резче: по его словам, это «в основном дым и зеркала».[3]
Число, объясняющее скромную долю дисперсии, всё равно может быть полезным — оно лучше, чем географическая близость и одна фотография. Но подавать его надо тем, что оно есть: априорной оценкой, а не пророчеством.
Как выглядит честная система совместимости
Если принять всё вышесказанное, из этого следует несколько проектных выводов, и мы их придерживаемся:
- Показывать диапазон, а не точку. «Вероятно, в районе 70+» правдивее, чем «78».
- Сообщать уверенность отдельно от балла. Двадцать отвеченных пунктов не должны выглядеть так же авторитетно, как двести. Малоинформативные совпадения должны выглядеть малоинформативными.
- Предпочитать ранг величине. «Верхний дециль вашего пула» переживает погрешность измерения лучше, чем двузначный процент: порядок устойчивее, чем расстояния.
- Отказываться различать внутри шума. Если два кандидата попадают в один доверительный коридор, показывайте их как равных. Навязанное ранжирование, которое нельзя обосновать, — это маленькая ложь, повторённая тысячи раз.
- Показывать драйверы. Какие три входных параметра сдвинули этот балл и в какую сторону? С баллом, который можно проверить, можно и спорить.
- Говорить, что его изменит. «Пройдите модуль про конфликты — и оценка станет примерно вдвое точнее» честнее любого знака после запятой.
Мы скорее скажем вам, что совпадение неопределённое, чем сфабрикуем точность, которую не можем защитить. Поэтому же разговаривают аватары: диалог вытаскивает тот самый специфичный для отношений сигнал, до которого не дотягивается ни один предварительный опросник. Балл сужает поле; разговор его проверяет.
Полевой справочник: шесть вопросов к любому показанному вам баллу
Задавайте их и нам тоже.
- Какова надёжность инструмента, лежащего в основе, и на ком она установлена?
- Сколько пунктов дали этот результат и как давно на них отвечали?
- Сопоставим ли этот балл между людьми — или это ранг внутри вашего пула, переодетый процентом?
- Какую минимальную разницу система считает значимой? Если ответа нет — она этого не знает.
- Какие входные данные сдвинули балл сильнее всего — и совпадает ли это с моим собственным ощущением важного?
- Проверялось ли хоть что-то в этой системе на реальных исходах отношений — или только на самоотчётной удовлетворённости экраном с результатом?
Если продукт не может ответить на большинство из них, число — декорация.
Размытая середина — это место, где вы и живёте
Вот то, что вслух обычно не произносят: для большинства пользователей бо́льшую часть времени подавляющая часть кандидатов находится в неразличимой полосе. Несколько человек явно не подходят — стоп-факторы сталкиваются, ценности расходятся жёстко. Несколько выглядят по-настоящему многообещающе. Все остальные — в размытой середине, и размытая середина не провал алгоритма. Это честная форма данных.
Балл хорош для сортировки: отсечь очевидно неподходящих, вывести на поверхность правдоподобно подходящих, избавить вас от перебора вживую. Чем он плох — так это выбором между 78 и 82.
Так что относитесь к числу как к прогнозу погоды. Семьдесят процентов вероятности дождя — полезно, это повод взять куртку. Но это не значит, что сегодня мокрее, чем при вчерашних шестидесяти восьми. Пройдите тесты, прочитайте диапазон — и идите вести тот разговор, на который число может только намекнуть.
Самое достойное доверия, что может сообщить вам матчинговая система, — это не то, насколько вы совместимы. А то, насколько она в этом уверена.
Источники
- Dating? A magic formula to predict attraction is more elusive than ever — ScienceDaily
- Online Dating: A Critical Analysis From the Perspective of Psychological Science — Psychological Science in the Public Interest
- Critics challenge the 'science' behind online dating — San Francisco Chronicle
Комментарии
Комментариев пока нет — будьте первым.