Cloud-Native SRE: Azure, AKS & Real-Time Data
Bottega52 Srl · , ·
- Work mode
- Hybrid
- Category
- SRE
Bottega52 Srl cerca un Site Reliability Engineer per potenziare infrastrutture Azure/Kubernetes, garantendo resilienza, scalabilità e sicurezza. Il ruolo è ibrido a Milano e include lavoro su Kafka, PostgreSQL e MongoDB, con attenzione a operazioni di on-call e miglioramento continuo.
Il candidato ideale possiede esperienza con Linux, Python, Terraform, CI/CD e principi SRE, ed è in grado di collaborare con team di sviluppo e di prodotto in un contesto internazionale.
Migliorare la resilienza ed ottimizzare il cluster Kubernetes (AKS su Azure) garantendo performance, scalabilità, sicurezza ed alta affidabilità. Configurare ed ottimizzare database relazionali (PostgreSQL su Azure) e non relazionali (MongoDB Atlas) per performance e sicurezza. Gestire e ottimizzare Apache Kafka (su AKS) per la raccolta e distribuzione di dati in tempo reale. Automatizzare processi operativi per ridurre il toil e migliorare l’efficacia dei team (Platform e Product). Partecipare alla turnazione on-call per rispondere rapidamente a incidenti. Sviluppare pipeline di monitoraggio e alerting per identificare rapidamente problemi operativi. Identificare rapidamente la root cause e documentare con automazioni per evitare problemi ricorrenti. Collaborare con lo sviluppo per migliorare il ciclo di vita SDLC con pratiche solide e coerenti. Lavorare su infrastrutture cloud-native moderne, resilienti e scalabili in contesto di stream processing ed edge computing. Laurea in Informatica o Ingegneria o esperienza equivalente. 3+ anni di esperienza con infrastrutture Cloud, preferibilmente Azure. Esperienza con sistemi distribuiti e alta scalabilità/resilienza per applicazioni cloud-native. Esperienza consolidata in ambienti Linux, inclusa gestione e debugging di problemi di networking (DNS, Load Balancer, firewall e VPN). Esperienza con tool di monitoraggio e logging (Prometheus, Grafana, Azure Monitor, ecc.). Esperienze nella creazione di automazioni (Python, Bash, Terraform) secondo Infrastructure-as-Code (IaC). Familiarità con Site Reliability Engineering, SLO/SLA e “error budgets”. Buona conoscenza dell’inglese scritto/parlato per interfacciarsi con clienti internazionali. Esperienza con database relazionali (PostgreSQL) e non relazionali (MongoDB). Esperienza con Apache Kafka e concetti di stream processing distribuito. Esperienza CI/CD (Jenkins, Gitlab, ecc.). Familiarità con architetture a microservizi e approcci DevOps/GitOps. Esperienza nella progettazione di sistemi distribuiti real-time e fault-tolerant. Wellhub Gold abbonamento MacBook Pro 14” (M3 Max) e iPhone azie Buoni pasto 8€ al giorno