Tech Stack
Job Description, Responsibilities & Requirements
Про посаду
Data Science UA - це сервісна компанія з глибоким досвідом у сфері AI та Data Science. Наша історія почалася у 2016 році з першої конференції Data Science UA у Києві, і з тих пір ми створили одну з найбільших AI спільнот у Європі.
Ми шукаємо Scraping Engineer, який буде проектувати, будувати та експлуатувати масштабні, стійкі системи веб-сканування, зосереджуючись на Google та подібних пошукових середовищах. Ця посада знаходиться на перетині інженерії даних, зворотної інженерії та надійності систем, і є ключовою для забезпечення точних, своєчасних та надійних даних у масштабі. Наш клієнт є лідером у впровадженні кодування з використанням інструментів AI. Посада ідеально підходить для тих, хто вірить в агентивне кодування та бажає покращити свої навички.
Обов'язки
- Проектування та підтримка масштабних Python систем сканування, які надійно працюють проти Google та інших високозахищених вебсайтів
- Створення скраперів для динамічних сторінок, багатих на JavaScript, з використанням автоматизації браузерів та гібридних підходів
- Постійне адаптування до змін у структурі сторінок, потоках запитів та механізмах протидії автоматизації
- Створення міцних піплайнів для витягнення даних, які пріоритезують точність, послідовність та спостережуваність даних
- Впровадження стратегій проксі, фінгерпринтингу та маршрутизації запитів для максимізації стабільності та продуктивності
- Моніторинг здоров'я сканування, раннє виявлення збоїв та швидке усунення проблем у виробництві
- Оптимізація продуктивності, витрат та латентностей у інфраструктурі сканування
- Тісна співпраця з інженерами даних, науковцями-датасаєнтистами та продуктовими командами для забезпечення того, щоб зібрані дані були корисними та достовірними
- Документування логіки сканування та експлуатаційних керівництв для довгострокової підтримки
Вимоги
- Професійний досвід роботи з Python (або іншою основною мовою, наприклад, GoLang, Rust, JavaScript), включаючи сканування системи виробничого рівня
- Досвід сканування Google або подібно захищених платформ
- Розуміння HTTP, TLS, cookies, headers, redirects та поведінки мережевого браузера
- Досвід роботи з такими інструментами, як Playwright, Selenium, Puppeteer або еквівалентними фреймворками автоматизації браузерів
- Знання HTML-парсинг, DOM-навігація та методи витягнення даних
- Досвід роботи з обмеженням швидкості, CAPTCHA, ротацією IP та системами виявлення ботів
- Зручність роботи з асинхронними та одночасними архітектурами сканування
- Досвід роботи зі скраперами у масштабі в хмарних середовищах
- Навички налагодження та здатність аналізувати складні режими збоїв
- Досвід роботи з фінгерпринтингом без браузера та методами запобігання виявленню ботів
Буде плюсом
- Знання контейнеризації та оркестрації, таких як Docker та Kubernetes
- Досвід роботи з розподіленими системами задач та чергами завдань
- Досвід у моніторингу якості даних та виявленні аномалій
- Досвід роботи з пошуковими, рекламними або конкурентними даними
Ми пропонуємо
- Культура стартап-інженерії
- Віддалена робота
- Сильна культура
- Нагороджений продукт
- Сток опціони
- Відпустка на основі довіри
- Гнучкий робочий графік
- Кар'єрний ріст
- Щомісячні Hackdays та Дні навчання
- Сімейний догляд
- Грошова допомога на домашній офіс
- Подарунок із свагу
- День народження без відробітку
- Регулярні соціальні заходи
- Волонтерські дні
Знаєте когось, хто б чудово підходив на цю посаду?
Подайте свого кандидата через програму рекомендацій та отримайте бонус за успішну рекомендацію!
Про компанію
Data Science UA - це сервісна компанія з глибоким досвідом у сфері AI та Data Science. Наша історія почалася у 2016 році з першої конференції Data Science UA у Києві, і з тих пір ми створили одну з найбільших AI спільнот у Європі.