About this job
<p>Wir suchen einen **Lead / Principal AI Infrastructure Architect**, der die durchgängige Verantwortung für den Entwurf, die Bereitstellung und die Optimierung der Infrastruktur für groß angelegte Workloads im Bereich Künstliche Intelligenz (KI) und maschinelles Lernen (ML) übernimmt.</p><p></p><p>Der Schwerpunkt der Rolle liegt auf der Architektur hochskalierbarer und kosteneffizienter Rechenumgebungen, einschließlich **GPU-Clustern, Plattformen für verteiltes Training, Infrastruktur für Model-Serving, Netzwerktechnik, Speicherlösungen, Orchestrierung sowie cloudbasierten KI/ML-Plattformen**.</p><p></p><p>Sie übersetzen Geschäftsziele, Service-Level-Anforderungen, Sicherheitsstandards und technische Rahmenbedingungen in robuste Infrastrukturarchitekturen. Sie evaluieren alternative Lösungen, treffen fundierte Architekturentscheidungen und stellen sicher, dass die Plattformen auf **Leistung, Skalierbarkeit, Zuverlässigkeit, Sicherheit und Kosteneffizienz** ausgelegt sind.</p><p></p><p>Als technische Führungskraft übernehmen Sie die architektonische Leitung, etablieren Engineering-Standards und Best Practices, betreuen (mentoren) Ingenieure und Architekten und arbeiten eng mit Kunden und Stakeholdern zusammen, um Infrastrukturstrategien und Roadmaps zu definieren.</p><p><strong>Requirements</strong></p><p>Absolut. Ich habe diese Stellenbeschreibung auf die gleiche Weise bereinigt: Arbeitgeberspezifische Formulierungen und Wiederholungen wurden entfernt, die Sprache gestrafft und **Verantwortlichkeiten, technische Anforderungen sowie Führungserwartungen** klar voneinander abgegrenzt – bei gleichzeitiger Wahrung des Senioritätsniveaus und der Kernanforderungen.</p><p></p><p># Lead / Principal AI Infrastructure Architect</p><p></p><p>## Über die Position</p><p></p><p>Wir suchen einen **Lead / Principal AI Infrastructure Architect**, der die durchgängige Verantwortung für den Entwurf, die Bereitstellung und die Optimierung der Infrastruktur für groß angelegte Workloads im Bereich Künstliche Intelligenz (KI) und maschinelles Lernen (ML) übernimmt.</p><p></p><p>Der Schwerpunkt der Rolle liegt auf der Architektur hochskalierbarer und kosteneffizienter Rechenumgebungen, einschließlich **GPU-Clustern, Plattformen für verteiltes Training, Infrastruktur für Model-Serving, Netzwerktechnik, Speicherlösungen, Orchestrierung sowie cloudbasierten KI/ML-Plattformen**.</p><p></p><p>Sie übersetzen Geschäftsziele, Service-Level-Anforderungen, Sicherheitsstandards und technische Rahmenbedingungen in robuste Infrastrukturarchitekturen. Sie evaluieren alternative Lösungen, treffen fundierte Architekturentscheidungen und stellen sicher, dass die Plattformen auf **Leistung, Skalierbarkeit, Zuverlässigkeit, Sicherheit und Kosteneffizienz** ausgelegt sind.</p><p></p><p>Als technische Führungskraft übernehmen Sie die architektonische Leitung, etablieren Engineering-Standards und Best Practices, betreuen (mentoren) Ingenieure und Architekten und arbeiten eng mit Kunden und Stakeholdern zusammen, um Infrastrukturstrategien und Roadmaps zu definieren.</p><p></p><p>## Kernaufgaben</p><p></p><p>### KI/ML-Infrastrukturarchitektur</p><p></p><p>* Übernahme der Gesamtverantwortung für Architektur und Design der Infrastruktur für groß angelegte KI/ML-Systeme – vom ersten Konzept bis zur Implementierung und Bereitstellung.</p><p>* Entwurf der Infrastruktur für verteiltes KI/ML-Training, Inferenz und Model-Serving-Workloads.</p><p>* Architektur und Optimierung des gesamten Rechen-Stacks, einschließlich **Rechenleistung, GPUs/Beschleunigern, Netzwerktechnik, Speicher, Orchestrierung und Model-Serving**.</p><p>* Evaluierung von Architekturalternativen und Treffen fundierter Entscheidungen auf der Basis von Leistung, Skalierbarkeit, Zuverlässigkeit, Kosten, Sicherheit und Kundenanforderungen.</p><p>* Sicherstellung, dass die Infrastrukturarchitekturen mit vereinbarten geschäftlichen SLAs, technischen Standards und betrieblichen Anforderungen im Einklang stehen.</p><p></p><p>### GPU- und Distributed Computing</p><p></p><p>* Entwurf und Optimierung groß angelegter **GPU- und beschleunigerbasierter Cluster** für KI/ML-Workloads.</p><p>* Evaluierung und Auswahl geeigneter GPU-/Beschleunigertechnologien basierend auf den Anforderungen der Workloads.</p><p>* Entwurf von Hochleistungsnetzwerken und Interconnect-Architekturen für verteiltes Training.</p><p>* Architektur von Speicherlösungen, die KI/ML-Workloads mit hohem Durchsatz unterstützen.</p><p>* Identifizierung und Behebung von Infrastruktur-Engpässen, die sich auf Training, Inferenz, Durchsatz oder Skalierbarkeit auswirken. * Optimierung der Infrastruktur hinsichtlich Leistung, Energieverbrauch, Auslastung und Kosten.</p><p></p><p>### Cloud-KI/ML-Architektur</p><p></p><p>* Fungieren als technischer Experte für mindestens eine der großen Hyperscaler-Plattformen, wie z. B. **AWS, Microsoft Azure oder Google Cloud**.</p><p>* Anwendung fundierter Kenntnisse in den Bereichen Cloud-KI/ML-Dienste, Rechenplattformen, Beschleuniger (Accelerators), Netzwerk, Speicher, Orchestrierung und Preismodelle.</p><p>* Bewertung von Cloud-Architekturoptionen und Empfehlung von Lösungen, die den Anforderungen an Workload, Sicherheit, Leistung und Kosten entsprechen.</p><p>* Entwurf skalierbarer Cloud- und Hybrid-Infrastrukturen für KI/ML-Workloads auf Unternehmens- und Großskalenebene.</p><p>* Identifizierung von Möglichkeiten zur Optimierung der Cloud-Auslastung und der Infrastrukturkosten.</p><p></p><p>### Architekturbewertung und Governance</p><p></p><p>* Leitung von Bewertungen und Überprüfungen bestehender und geplanter KI/ML-Infrastrukturumgebungen.</p><p>* Identifizierung von Architekturlücken, technischen Risiken, Leistungsengpässen, Skalierbarkeitsproblemen und Optimierungspotenzialen.</p><p>* Festlegung von Strategien zur Problembehebung und Erarbeitung technischer Empfehlungen.</p><p>* Etablierung von Architekturstandards, Mustern (Patterns) und Best Practices für die KI-Infrastruktur.</p><p>* Dokumentation von Architekturentscheidungen, Annahmen, Abwägungen (Trade-offs) und technischen Begründungen.</p><p>* Sicherstellung der Einhaltung relevanter Sicherheits-, Regulierungs-, Governance- und Kundenstandards.</p><p></p><p>### Infrastruktur-Roadmap und Kapazitätsplanung</p><p></p><p>* Definition und Pflege der Technologie-Roadmap für die KI/ML-Infrastruktur.</p><p>* Entwicklung von Kapazitätsplänen unter Berücksichtigung der Anforderungen von Geschäftsbereichen, Produkten und KI/ML-Workloads.</p><p>* Prognose des Bedarfs an Rechenleistung, Speicher, Netzwerkkapazität und Beschleunigern.</p><p>* Entwicklung von Kostenmodellen für die Infrastruktur und Identifizierung von Möglichkeiten zur Kostenoptimierung.</p><p>* Planung der technologischen Weiterentwicklung, des Workload-Wachstums und der Plattform-Skalierbarkeit.</p><p></p><p>### Automatisierung, Bereitstellung und Betrieb</p><p></p><p>* Entwurf von Bereitstellungs- und Automatisierungsstrategien für eine zuverlässige, reproduzierbare und skalierbare KI/ML-Infrastruktur.</p><p>* Etablierung geeigneter **CI/CD- und Infrastructure-as-Code-Ansätze** für KI/ML-Plattformen und -Workloads.</p><p>* Unterstützung der automatisierten Bereitstellung von KI-Systemen, Modellen und Datenpipelines in Produktionsumgebungen.</p><p>* Definition von Betriebsprozessen zur Gewährleistung von Zuverlässigkeit, Skalierbarkeit und Reproduzierbarkeit.</p><p>* Etablierung von Strategien für Monitoring und Observability über Infrastruktur- und MLOps-Umgebungen hinweg.</p><p>* Definition und Überwachung von **SLAs**.</p><p>Find <a href="https://www.arbeitnow.com">Jobs in Germany</a> on Arbeitnow</a>