Higgsfield AI — самая быстрорастущая генеративная AI-компания в истории: $500M годовой выручки (ARR), 25M+ пользователей по всему миру, 6M+ генераций в день, и среди наших клиентов — 390 брендов из списка Fortune 500. Мы работаем на самом фронтире AI-видео и next-generation креативных инструментов. Присоединиться к Higgsfield — значит стать частью команды, которая формирует будущее AI-native продуктов, в компании, которая не просто движется быстро, а переписывает само понятие «быстро».
О команде
Команда Data Acquisition в Higgsfield AI отвечает за все аспекты сбора данных для обучения наших моделей. Мы находим, загружаем и подготавливаем сотни миллионов медиа-объектов и петабайты видео, изображений и аудио, работая в тесной связке с командами Data Processing, Infrastructure, ML и Legal. Мы ищем сильного инженера в команду Data Acquisition.
Чем вы будете заниматься
- Вести инженерные проекты в области сбора данных: web crawling, ingestion, крупномасштабный сбор медиа.
- Разрабатывать и эксплуатировать высокомасштабируемые распределённые системы, работающие с петабайтами данных.
- Проектировать и писать production-сервисы на Python для конкурентной обработки с высокой пропускной способностью, разделяя CPU-bound, I/O-bound и GPU-bound стадии пайплайна.
- Строить отказоустойчивый ingestion из внешних источников: rate limiting, ретраи с backoff, connection pooling, корректная работа при деградации источников.
- Обеспечивать resumability и идемпотентность пайплайнов: чекпоинты, дедупликация по контенту, восстановление без полного перезапуска обработки.
- Разрабатывать и поддерживать backend-сервисы хранения данных: object storage на больших объёмах и реляционные хранилища метаданных под нагрузкой.
- Разворачивать решения в Kubernetes: автоскейл по глубине очереди, корректное поведение на spot-инстансах, регулярные проверки состояния систем.
- Инструментировать и мониторить сервисы через Prometheus, Grafana, VictoriaLogs и Sentry, анализировать производительность и устранять узкие места.
- Работать с ML-командами над составом, покрытием и качеством датасетов под требования обучения.
- Взаимодействовать с юридической командой по вопросам комплаенса и приватности данных.
Требования
- 3+ года индустриального опыта в разработке.
- Сильный Python и опыт разработки production-сервисов, работающих под постоянной нагрузкой.
- Глубокая экспертиза в распределённых системах и обработке данных на больших объёмах: брокеры очередей, at-least-once семантика, идемпотентность, backpressure.
- Опыт обработки крупных мультимодальных медиа-датасетов.
- Уверенное понимание сетевого стека и работы с высоконагруженными HTTP-клиентами.