
Senior Site Reliability Engineer
Primary stack
Nice to have's
Job description
Про посаду
Ми шукаємо Senior Site Reliability Engineer для приєднання до нашої динамічної та зростаючої команди, яка підтримує сферу Customer Last Mile та Order Services. На цій посаді ви внесете свій глибокий досвід у AWS Bedrock та OpenSearch (налаштування індексу та продуктивності) для забезпечення надійності, масштабованості та продуктивності нашого екосистеми критичних мікросервісів.
Обов'язки
- Відповідальність за виробничі середовища, включаючи черговість та обробку великих інцидентів
- Керівництво аналізом кореневих причин та забезпечення завершення управління проблемами
- Визначення та підтримка SLO/SLI, просуваючи підхід з акцентом на надійність серед команд
- Управління та оптимізація робочих процесів Kubernetes в AWS (EKS/ECS)
- Управління інфраструктурою як кодом за допомогою Terraform та Ansible
- Впровадження та підтримка рішень моніторингу, сповіщень та спостереження за допомогою Instana, CloudWatch та ELK
- Проведення аналізу логів, гігієни сповіщень та планування потужностей
- Підтримка моделей надійності для мікросервісів CLM, включаючи API та асинхронну/подієву обробку
- Налаштування та підтримка індексів AWS Bedrock та OpenSearch для оптимальної продуктивності
- Застосування принципів безпеки з самого початку для всієї інфраструктури та сервісів
- Заохочення практик автоматизації, документування та співпраці між командами
- Участь у черговості підтримки поза робочим часом, покриваючи одне календарне тиждень приблизно раз на місяць
Вимоги
- 3+ роки досвіду в Site Reliability Engineering або суміжних операційних ролях
- Експертиза в AWS Bedrock та OpenSearch з акцентом на налаштування індексу та продуктивності
- Знання основ AWS, включаючи EC2, EKS/ECS та IAM/мережеве управління
- Досвід у експлуатації Kubernetes у виробничому масштабі
- Навички у інфраструктурі як коді з Terraform
- Знання інструментів спостереження, таких як Instana, CloudWatch та ELK
- Розуміння моделей надійності мікросервісів, API та асинхронної/подієвої обробки
- Знання визначення SLO/SLI, методологій RCA та практик управління проблемами
- Знання принципів безпеки з самого початку та операційної безпеки
- Здатність до виробничої відповідальності, обов'язків поза робочим часом та реагування на великі інциденти
- Сильна співпраця, документування та підхід з акцентом на автоматизацію
- Володіння англійською мовою на рівні B2 для забезпечення ефективного спілкування та документування
Буде плюсом
- Гнучкість у використанні Ansible для управління конфігурацією
- Демонстрація передових практик планування потужностей та гігієни сповіщень
- Кваліфікація в налаштуванні великих пошукових та AI/ML платформ
Ми пропонуємо
- Можливість працювати дистанційно з Києва, Україна
- Бути частиною зростаючої та динамічної команди
- Конкурентоспроможний компенсаційний пакет
Про компанію
[Опис компанії, якщо є]
© EPAM. This job description was sourced from the employer's public career page. TheJob is not the employer — we index the posting and route candidates to the source. All content rights and hiring decisions belong to the employer.
EPAM helps organizations innovate their business processes and rethink the way they manage their businesses so they can remain competitive in this new digital age.

