Привет! Я Радослав, руковожу группой ML-разработки в лаборатории ИИ. Мы занимаемся прикладными исследованиями для продуктов Яндекса и делаем прототипы новых решений. Во многих задачах заранее непонятно, что сработает, — в этом и интерес. Ищу человека, которому тоже нравится разбираться, пробовать и доводить идеи до результата. Многому научим: преподавательский опыт у меня есть ;)
Наша лаборатория занимается прикладными исследованиями: мы улучшаем продукты Яндекса и делаем прототипы новых решений. Работаем с NLP, CV, RL, звуком и, конечно, на стыке этих областей. В общем, сначала разбираемся, какая реальная боль перед нами стоит, какую задачу решать, а уже потом выбираем подходящие инструменты.
Несколько последних продуктовых результатов нашей команды: детектор сгенерированных текстов, изображений и кода; механизм автоматической оценки уровня знаний студентов; технический писатель. Из исследовательских — методология анализа предпочтений LLM; анализ условий, при которых в мультиагентном RL возникает язык как механизм коммуникации. Цель одних проектов — выход в прод, других — научная публикация, а третьих — и то и другое.
Ищем человека, которому интересно работать над задачами, где пока не очень понятно, как вообще подступиться к решению. Интересно пробовать, проверять гипотезы, разбираться, почему не получилось, и пробовать ещё. Хотим, чтобы вы предлагали свои идеи и развивались вместе с нами. Многому готовы научить: руководитель группы ML-разработки — опытный преподаватель ;)
P. S. А ещё мы пишем научные статьи на A*. Присоединяйтесь!
Механизм для оценки значимости научных публикаций
Ищем новый способ оценить вклад научных публикаций: просто оценка количества цитирований достаточно грубая. Это может помочь и фильтровать информационный поток (все публикации всё равно не прочитать), и готовить данные для обучения новых поколений языковых моделей.
Нейродетектор для текстов, изображений и кода
Учим модели отличать сгенерированные тексты, изображения и код от созданных человеком. При этом генераторы тоже развиваются, поэтому хочется, чтобы детектор справлялся и с новыми моделями. Как этого добиться — один из вопросов, с которыми предстоит разбираться.
Автоматизация проверки уровня знаний
Автоматизируем проверку знаний там, где личная проверка один на один с собеседующим/преподавателем невозможна. Здесь много открытых вопросов: как собирать данные, как проверять качество оценки и насколько вообще ей можно доверять.
Методология анализа предпочтений LLM
Исследуем, что предпочитают языковые модели, как это измерить и чем можно объяснить результат. Разрабатываем методологию и проверяем её экспериментами. Тут придётся подумать и над самими экспериментами, и над тем, какие выводы из них действительно можно сделать.
Больше об ML в Яндексе — в канале Yandex for ML
Это дополнительные плюсы, а не обязательные требования. Поможем разобраться. Агенты тоже помогут, но результат всё равно будем проверять ;)