Банк вопросов
Вопросы на собеседовании: Computer Vision
Модель для изображений может хорошо работать на тестовой выборке и ошибаться после смены камеры или освещения. Проверьте понимание архитектур, подготовки данных и оценки качества. Для каждого решения обсудите, какие изменения входных данных сделают его ненадёжным.
Показано 15 из 75 вопросов
Какие аугментации использовали при обучении визуальной модели?
А как модели распознать физически, что картинки одинаковые?
Ты говорил, я насколько услышал, есть ли задачи по опыту компьютер-вижен на видео и задачи более стандартные?
Что касаемо задач и проектов, которые связаны с EVE?
Как я понял, у нас есть модель для первого лица, да? Или нет?
То есть задача пикселизации видео, как я понимаю, да?
То есть от первого лица есть, от третьего нет. От первого лица, я так понял, это сферические видео, да?
Как реализовать конвертацию 2D видео в 3D с использованием depth estimation и проекций?
Как реализовать систему AI Editor для автоматической обработки видео модераторами?
Как автоматически нарезать VR-видео на короткие сегменты для TikTok?
Дальше, следующая задача. Это задача Outpaint. Это задача для того, чтобы дорисовывать видео до сферического видео. То есть у нас есть видео с маленьким Field of View. Хотели бы дорисовать там до 180 градусов. Задача интересная, но задача сильно исследовательская. Потому что здесь не сделано ничего, но есть представление о том, как это делать. Я писал когда-то Open Source для этой задачи, выложил проект, там даже неплохо он звездочек набирает и так далее. В общем, люди пользуются, но подходы есть. То есть мы берем видео и дорисовываем. Но это все базируется на Open Source видео-генераторах.
Есть задача Six Degrees of Freedom, движение в видео. Здесь эта задача в основном ресерч. Не сделано практически ничего. У нас есть контракт с какими-то китайскими исследовательскими группой, которая занимается сплатингами для видео. Для них сейчас построили даже студию в Лос-Анджелесе, чтобы они снимали видео там сотнями камер со всех сторон. И они даже наснимали там какое-то количество контента. Но это все не очень масштабируемо. В общем, хотелось бы покопаться в эту задачу. В идеале придумать как из видео обычного, с двух камер, сделать видео-волюметрик, которым можно походить. Эта задача очень трудоемкая, очень не гарантированная. Она сложная, трудоемкая, не гарантированная. То есть очень много ресерча нужно здесь делать. И в приоритетах она стоит собственно из-за того, что результат не гарантирован, не очень высоко. Хотя мне действительно было бы очень интересно этим заниматься.
А еще что сам алгоритм детектил? Типа какие-то ошибки в картинках?
Как вы работаете с NSFS составляющей в вашем продукте?
Можем какую-то информацию дополнительную из текста и картинок вытащить?
Подготовьтесь к следующему интервью с Vibe Interview.
Скачать Vibe Interview