Банк вопросов
Вопросы на собеседовании: Machine Learning
На собеседовании недостаточно назвать метрику или модель: нужно объяснить, почему вы выбрали её для задачи. Проверьте, можете ли вы связать обучение, регуляризацию, валидацию и оценку качества с конкретным примером. Сначала ответьте своими словами, затем уточните допущения и ограничения.
Показано 20 из 746 вопросов
Какие предположения про задачу должны быть, чтобы мы могли принять линейную регрессию?
Если есть категориальные признаки, можно ли их как-то использовать в линейной регрессии?
Что произойдёт с линейной регрессией, если в данных есть мультиколлинеарность?
Просто как их добавить или какие из этих фичей сделать так, чтобы наша модель стала лучше?
Можно ли сделать агрегат — посещал ли человек на этой неделе определённую категорию (бинарный признак)?
Не теряется ли информация в разреженных векторах при агрегации?
Обсудили функцию потерь (log loss), а какая метрика будет использоваться?
Как проверить, удалось ли достичь желаемого результата?
А не пробовали объединить, типа, признак добавить, не знаю, город, как категорию?
Кластеризация используется для решения проблемы холодного старта?
Используете ли вы усреднённые предсказания для новых товаров на основе кластеров?
DBSCAN находит выбросы (outliers). Как вы поступали с этими магазинами — дообъединяли их или обрабатывали отдельно?
И ты, соответственно, про них не знаешь. Может быть, они и хорошие, но старая модель запретила. Вот как ты проблему решал?
Как маркировать отказы в задачах кредитования для обучения модели?
Как вы разбивали данные — рандомно или по кластерам/группам? Как обеспечивали стратификацию?
Что вы делали с признаком, если он принимал только одно значение (константа)?
Как вы делили? Какой сплит использовали? Out of time или out of sample?
Достаточно ли оценки только на отложенной выборке перед запуском в продакшен?
И насколько важно, чтобы трейн и тест были одинаково распределены?
Подготовьтесь к следующему интервью с Vibe Interview.
Скачать Vibe Interview