Job description
Wizdaa, leader innovant dans le domaine de l'intelligence artificielle appliquée, recherche un(e) Architecte Plateforme senior capable de définir et d’élever les standards de construction, de déploiement et d’exploitation des systèmes de ML/AI à grande échelle. Vous évoluerez à l’intersection de l’infrastructure ML et du SRE, en étant le garant du parcours complet du modèle, de la phase de recherche à la mise en production fiable.
**Missions principales**
- Concevoir, déployer et maintenir une infrastructure de serving de modèles et d’inférence capable de gérer la latence, le débit, l’autoscaling et la haute disponibilité pour des charges en temps réel et batch, sur plusieurs locataires.
- Piloter le cycle de vie complet du déploiement ML : registre des modèles, versionning, workflows de promotion, stratégies de rollout (canary, shadow, A/B) et mécanismes de rollback sécurisés.
- Gérer les workloads agentiques et LLM en production, incluant la configuration des fournisseurs d’inférence, la gestion des quotas (TPS/TUPS), les garde-fous, la gestion des prompts/versions et la dégradation gracieuse sous forte charge.
- Construire des pipelines ML reproductibles et automatisés (training, évaluation, déploiement) en tant que code, avec traçabilité et linéarité des données.
- Étendre l’infrastructure‑as‑code aux systèmes ML via Terraform, en adoptant une architecture multi‑projets qui aligne les standards ML avec le reste de la plateforme.
- Implémenter le GitOps pour les workloads ML, en assurant la configuration d’ArgoCD et les workflows de promotion entre environnements et locataires.
- Exploiter les workloads ML/AI sur un cluster Kubernetes multi‑tenant (GKE), en orchestrant le scheduling GPU/accelerators, l’isolation des locataires et la capacité sensible aux coûts.
- Définir et suivre les indicateurs de fiabilité et d’observabilité (SLO/SLA) pour les services d’inférence, incluant le monitoring, le tracing et les alertes.
**Profil recherché**
- Minimum 5 ans d’expérience en architecture de plateformes cloud, idéalement sur Google Cloud Platform, avec une solide maîtrise des services GKE, Vertex AI, Cloud Run, Cloud Functions, Pub/Sub, BigQuery, etc.
- Expertise avérée en SRE/DevOps : CI/CD, IaC (Terraform, Helm), GitOps, monitoring (Prometheus, Grafana, Stackdriver) et gestion d’incidents.
- Expérience concrète dans le déploiement de modèles ML à grande échelle, incluant le serving, le scaling, la gestion des coûts d’inférence et la mise en place de stratégies de rollout sécurisées.
- Connaissances approfondies des concepts de ML Ops, pipelines de données, versionning de modèles (MLflow, DVC) et reproducibility.
- Maîtrise des architectures micro‑services, des API REST/GraphQL, des protocoles de communication (gRPC, HTTP/2) et des bonnes pratiques de sécurité cloud.
- Capacité à travailler en équipe multidisciplinaire, à anticiper les problèmes, à proposer des solutions innovantes et à influencer la roadmap produit.
- Anglais professionnel requis ; le français est un atout.
**Ce que nous offrons**
- Un environnement de travail stimulant au sein d’une start‑up en forte croissance, avec des projets à fort impact business.
- Possibilité de télétravail hybride (2 jours par semaine au bureau).
- Pack de rémunération compétitif (CDI) avec bonus basé sur la performance.
- Accès à des formations continues, conférences IA/ML et certifications cloud.
- Culture d’entreprise axée sur l’innovation, la collaboration et le bien‑être des collaborateurs.
Rejoignez Wizdaa et participez à la construction de la prochaine génération de plateformes IA/ML qui transformeront les entreprises à l’échelle mondiale.