Команда Detector Alignment входит в отдел восприятия Автономного транспорта. Наша задача — обеспечить, чтобы автомобиль правильно «видел» и понимал окружающую среду в любых условиях: днём и ночью, в дождь, снег и туман.
Мы обрабатываем данные с камер, лидаров и радаров, разрабатываем нейросетевые алгоритмы и внедряем их в работу автомобиля.
Сейчас в нашем стеке восприятия много разных компонентов с похожей семантикой: Occupancy Grid, Height Grids, лидарная семантическая сегментация, отдельные компоненты для работы со статикой и динамикой. Каждому из них нужна своя разметка, настройка и свой бюджет latency. При этом все они по сути описывают одно и то же: что и где занимает пространство вокруг машины.
Мы считаем, что все эти компоненты можно объединить в единое представление: 3D Occupancy Grid. Нам нужен специалист, который возглавит эту работу — от создания исследовательского PoC до внедрения продакшен‑модели в автомобиль.
Важный момент: разработка ведётся на новой query‑based модели восприятия. Мы отказываемся от набора независимых компонентов над плотными признаковыми картами и переходим к единому трансформерному бэкбону. В нём разные задачи будут выражаться через обучаемые queries.
Это значит, что вам предстоит работать не с устаревшей архитектурой, а с системой, которая только формируется. Ваши решения по дизайну 3D OG в этой архитектуре во многом определят, как будет работать система восприятия автомобиля в ближайшие годы.
Анализ методов 3D Occupancy Prediction
Вы будете изучать современные методы прогнозирования occupancy в 3D: и на основе данных с камеры (camera-only), и с объединением данных камеры и лидара (camera-lidar fusion). Нужно оценить, насколько эти методы подходят для нашей сенсорной конфигурации и вычислительного бюджета, а также обосновать, какую архитектуру стоит выбрать.
Интеграция 3D OG
Нужно спроектировать работу occupancy в трансформерной модели: разобраться в устройстве voxel/occupancy queries, понять, как функционирует cross-attention с признаками камер и лидара, выяснить, как задача разделяет бэкбон с детекцией и другими головами, а также найти способы избежать негативного transfer между задачами.
Анализ пайплайна и работа с датасетом
Вы будете разбирать текущий пайплайн генерации псевдоразметки для статических и динамических объектов: поймёте, как он работает, какие у него ограничения и где есть возможности для развития. Также соберёте датасет карт занятости и создадите стабильный пайплайн, который позволит регулярно пополнять датасет.
Обучение модели
Вы будете реализовывать и обучать модель, которая предсказывает 3D OG. Нужно продумать, как оценивать её работу: использовать метрики precision, recall, F1, IoU (по классам и по дальностным зонам), проанализировать предсказания визуально, а также честно сравнить разные подходы между собой и с текущими решениями.
Унификация голов восприятия
Вы будете постепенно заменять разные типы голов — OG, AG, height grids, лидарную сегментацию — единым представлением в виде voxel grid. При этом важно сохранить качество работы в критичных сценариях.
Оптимизация latency
Вы будете оценивать и оптимизировать стоимость инференса в рамках текущего бюджета, работать с realtime‑ограничениями на целевом оборудовании и доводить модель до стабильной работы на автомобиле.
Улучшение детекции
Вы будете итеративно повышать качество детекции: работать с лоссами и семплированием, применять аугментации и self-/semi-supervised-подходы, использовать дистилляцию, анализировать ошибки и работать с длинным хвостом сценариев.
Alignment и устойчивость
Вы будете обеспечивать, чтобы модели хорошо работали в разной погоде и освещённости, на различных сенсорных конфигурациях и в новых географических зонах. Также вам предстоит разрабатывать алгоритмы, которые определят, при каких условиях можно эксплуатировать систему (например, учитывать погоду, состояние дороги и деградацию сенсоров).
Больше об ML в Яндексе — в канале Yandex for ML