Join Our Journey
AI Ops
משרה מס’ 1007095
קצת על התפקיד:
• ניהול, תחזוקה וניטור של תשתיות AI ארגוניות בסביבות On-Prem ובענן• אחריות על זמינות, ביצועים ו-Scalability של פלטפורמות, כלים ורכיבי תשתית לעומסי AI/ML
• עבודה עם פלטפורמות AI/ML כגון MLflow ו-Kubeflow
• ניהול סביבות Docker ו-Kubernetes, כולל עומסי AI וניצול יעיל של משאבי GPU
• הקמה ותחזוקה של תהליכי CI/CD ואוטומציה באמצעות Python, Bash ו-Infrastructure as Code
• ניטור תשתיות באמצעות Prometheus ו-Grafana, לצד Troubleshooting של תקלות מורכבות
• עבודה עם תשתיות ענן, בדגש על Azure, ושיתוף פעולה עם צוותי AI וגורמים טכנולוגיים בארגון
מה אנחנו מחפשים?
• ניסיון מוכח בניהול ותפעול תשתיות IT וניסיון משמעותי בסביבת Linux• ניסיון מעשי עם MLflow ו-Kubeflow
• ניסיון עם Jenkins, GitLab CI או GitHub Actions
• ניסיון בניהול תשתיות ענן ב-Azure, AWS או GCP – ניסיון ב-Azure יתרון משמעותי
• ניסיון מעשי עם Docker ו-Kubernetes וניהול ואופטימיזציה של GPU לעומסי AI/ML
• ניסיון ב-Terraform או Ansible ובכתיבת סקריפטים ב-Python וב-Bash
• ניסיון עם Prometheus ו-Grafana והבנה טובה של Networking במערכות מבוזרות
• היכרות עם Best Practices בתחום אבטחת תשתיות ויכולת גבוהה לאיתור ולפתרון תקלות