AI Platform Operations Engineer (m/w/d)
AI Platform Operations Engineer (m/w/d)
Aktuell sind wir auf der Suche nach einem Infrastructure Engineer für den Betrieb einer On-Premise KI Plattform.
Beim Aufbau und Betrieb einer vollständig On-Premise betriebenen KI-Plattform suchen wir einen erfahrenen Experten im Bereich AI Platform Operations. Der Fokus liegt auf dem zuverlässigen Betrieb der KI-Infrastruktur, der Verwaltung des Inferenz-Stacks sowie der Kapazitätsplanung für GPU-basierte Workloads.
Zu Ihren Aufgaben gehören:
- Eigenverantwortlicher Betrieb und Überwachung der KI-Inferenzplattform einschließlich Model Orchestrator
- Dynamisches Laden, Entladen und Verwalten von KI-Modellen unter Berücksichtigung von GPU- und VRAM-Ressourcen
- Monitoring, Analyse und Optimierung der GPU-Auslastung sowie der Systemperformance
- Planung und Durchführung temporärer Benchmark- und Lasttest-Szenarien mit zusätzlichen Modellen und erhöhtem VRAM-Bedarf
- Verwaltung und Pflege lokaler KI-Modelle (GGUF) sowie der zugehörigen Inferenzumgebung
- Betrieb und Wartung des KI-Technologie-Stacks, insbesondere llama.cpp, whisper.cpp, OpenAI-kompatibler APIs und LangGraph
- Administration und Betrieb der Vektordatenbank Qdrant im Kontext von Retrieval-Augmented Generation (RAG)
- Kapazitätsplanung und Skalierungsmanagement für den Ausbau der GPU-Infrastruktur
- Optimierung von Queue-, Batch- und Scheduling-Prozessen zur effizienten Ressourcennutzung
- Steuerung und Integration von Hersteller-Releases und Container-Images
- Überwachung und Absicherung der definierten Netzwerkverbindungen für Lizenzierung, Modelldownloads und freigegebene externe Dienste
- Sicherstellung des Betriebsprinzips „vollständig On-Premise“ ohne Nutzung von Cloud-KI-Diensten
**Anforderungen:**
- Mehrjährige Erfahrung im Betrieb von Linux-Servern in produktiven Umgebungen
- Fundierte Erfahrung mit Docker und containerisierten Anwendungen
- Praktische Erfahrung im Betrieb von GPU-basierten KI- oder Machine-Learning-Plattformen
- Kenntnisse im Performance-Monitoring sowie in der Analyse von Ressourcenengpässen (insbesondere GPU und VRAM)
- Erfahrung im Betrieb und in der Administration von KI-Inferenzumgebungen
**Zusätzliche Informationen:**
Konnten wir Ihr Interesse wecken? Dann freuen wir uns auf die Zusendung Ihres aussagekräftigen Expertenprofils unter Angabe Ihrer Stundensatzvorstellung.
Projekt-Nr.: 107219
Stellentyp: freiberuflich
Einsatzort: Remote
Start: asap
Dauer: 6 Monate