Перейти к содержимому
На этой странице

Рекомендательные системы

Все темы Data Scientist

Подтемы:

Как решать cold start для нового пользователя в рекомендательной системе?

Для нового пользователя сначала дают неперсонализированный baseline: популярное или трендовое с учетом региона, времени и доступности. Onboarding может собрать несколько предпочтений, а контентные признаки профиля и объектов дают раннюю персонализацию. Часть показов оставляют для controlled exploration, чтобы быстрее узнать интересы и не замкнуть пользователя в первом выборе. После накопления событий растет вес коллаборативных сигналов. Оценивают activation, diversity, long-term retention и regret, а не только первые клики.


Чем коллаборативные рекомендации отличаются от контентных?

Коллаборативные методы учатся по матрице взаимодействий user-item и находят сходство пользователей или скрытые факторы. Они не требуют полного описания объектов, но страдают от cold start и feedback loop. Контентные методы сравнивают признаки пользователя и объекта, поэтому могут рекомендовать новый объект, но часто дают слишком похожие результаты. Гибрид объединяет оба сигнала и добавляет популярность, контекст и ограничения. Split делают по времени, чтобы будущие взаимодействия не попадали в признаки.


Popularity bias, как бороться?

Popularity bias (популярный биас) возникает, когда рекомендательная система предлагает пользователю только самые популярные или общеизвестные элементы, игнорируя индивидуальные предпочтения пользователя. Вот несколько способов борьбы с ним:

  1. Персонализация: Используйте персонализированные методы ранжирования, которые учитывают предпочтения и историю взаимодействия конкретного пользователя с контентом.

  2. Разнообразие: Интегрируйте в систему механизмы, которые обеспечивают разнообразие рекомендаций, чтобы предложения не были ограничены только самыми популярными элементами.

  3. Фильтрация по контексту: Учитывайте контекст, такой как время, местоположение, текущая активность пользователя и т. д., для адаптации рекомендаций к конкретной ситуации.

  4. Гибридные модели: Используйте комбинацию различных методов рекомендаций, таких как коллаборативная фильтрация, контентная фильтрация, гибридные подходы и т. д., для более точных и разнообразных рекомендаций.

  5. Управление экспозицией: Регулируйте видимость популярных и непопулярных элементов с помощью техник, таких как балансировка и динамическая регулировка рекомендаций в зависимости от интересов пользователя.


Метрики качества рекомендаций. Помимо классических спросил еще про diversity, новизну контента.

Метрики качества рекомендаций оценивают эффективность рекомендательных систем. Вот несколько классических метрик:

  1. Точность (Precision): Оценивает долю релевантных рекомендаций среди всех предложенных. Формула:

    Кол−во релевантных рекомендацийКол−во предложенных рекомендаций\frac {Кол-во релевантных рекомендаций} {Кол-во предложенных рекомендаций}

    .

  2. Полнота (Recall): Оценивает долю релевантных рекомендаций, найденных из всех релевантных элементов. Формула :

    Кол−во релевантных рекомендацийКол−во всех релевантных элементов\frac {Кол-во релевантных рекомендаций} {Кол-во всех релевантных элементов}

    .

  3. F-мера (F1-score): Гармоническое среднее между точностью и полнотой, позволяющее учесть обе метрики. Формула:

    𝐹1=2⋅Precision⋅RecallPrecision+Recall𝐹1=2 \cdot \frac {Precision \cdot Recall} {Precision+Recall}

    .

  4. Средний ранг (Average Rank): Средний ранг релевантных элементов в списке рекомендаций.

  5. Разнообразие (Diversity): Оценивает степень разнообразия предлагаемых рекомендаций. Может измеряться, например, как разнообразие жанров, авторов или других аспектов контента.

  6. Новизна контента (Content Novelty): Оценивает степень, в которой рекомендации предлагают новый и неожиданный контент для пользователя. Может измеряться, например, как доля рекомендаций среди элементов, которые пользователь еще не видел или не взаимодействовал с ними.

Собеседования: Data Science

Смотри записи интервью, узнай, какие вопросы задают и как отвечают кандидаты.

Вопросы и ответы

Не нашли ответ? Напишите мне в чат. Я делаю Шпаргалку и сам отвечаю на сообщения. Расскажите, что не работает или чего вам не хватает. Может, смогу сразу взять это в работу.

Откуда взяты вопросы?

Из реальных собеседований. Основой подборки стал опыт Вадима Новосёлова: он проходил интервью и записывал вопросы. Подробнее о материалах.

Насколько эти вопросы актуальны?

Эти вопросы встречались нам на реальных собеседованиях в 2025 году. Мы регулярно проходим собеседования и пополняем подборку новыми вопросами. Основы профессии и ключевые технологии остаются востребованными годами, а детали конкретных инструментов и версий стоит сверять с текущей документацией.

На какой уровень рассчитана подборка?

Мы проходили собеседования на вакансии уровня Middle+, а иногда и на Senior-позиции. Вопросы из этих интервью вошли в подборку. Направления работы: Data Scientist, ML-инженер. Глубина обсуждения зависит от вакансии: будь готов объяснить основную идею, привести практический пример и разобрать ограничения и альтернативы решения.

Этот вопрос точно будет на моём собеседовании?

Гарантии нет: набор вопросов зависит от компании, задач команды, уровня вакансии и самого интервьюера. Эти вопросы уже встречались на реальных собеседованиях, но на твоём интервью ту же тему могут проверить другой формулировкой, практической задачей или обсуждением твоего опыта. Используй подборку, чтобы разобраться в теме: объясняй идею своими словами, приводи примеры и готовься обсудить ограничения и альтернативы решения. Так будет проще ответить и на знакомый вопрос, и на неожиданные уточнения.