Мы разрабатываем платформу для извлечения актуальных сложноструктурированных данных из интернета — они станут основой для работы агентов на базе больших языковых моделей (LLM). Наша цель — автоматизировать создание источников данных и формирование разнообразных продуктовых обогащений ответов. Эти данные будут использоваться в поиске и AI‑приложениях для пользователей по всему миру: они помогут мгновенно решать повседневные задачи и удовлетворять самые разные интересы. Проект предполагает не только автоматизацию ранее трудоёмкого процесса сбора данных, но и выстраивание компонентов инфраструктуры (харнесса) для работы агентских систем.
Проектирование конвейеров для анализа пользовательских логов и поиска информации в интернете
Вы будете разрабатывать системы, позволяющие эффективно обрабатывать большие объёмы данных и извлекать из них полезную информацию.
Обеспечение стабильности и достоверности данных
От качества данных напрямую зависит точность ответов, которые получат миллионы пользователей. Вам предстоит выстроить процессы контроля и верификации данных.
Разработка моделей для выявления пользовательских интересов и отслеживания актуальных событий в мире
Вы будете создавать алгоритмы, способные анализировать поведение пользователей, и оперативно реагировать на изменения в информационном пространстве.
Создание моделей, определяющих, какие агентские инструменты необходимы для решения конкретных задач
Ваша работа поможет оптимизировать выбор инструментов для AI‑агентов, повышая эффективность их работы.
Больше об ML в Яндексе — в канале Yandex for ML