AI Inference Engineer
Job in
Germany, Pike County, Ohio, USA
Listed on 2026-07-02
Listing for:
EXXETA AG
Full Time
position Listed on 2026-07-02
Job specializations:
-
Software Development
AI Engineer (Applied/Software), Cloud Engineer - Software, AWS
Job Description & How to Apply Below
Location: Germany
Als AI Inference Engineer baust du die technische Grundlage für produktive AI-Systeme in regulierten Umgebungen. Du entwickelst und betreibst LLM-Inferenzplattformen, die on‑premises oder in privaten Cloud‑Umgebungen laufen – sicher, skalierbar, beobachtbar und wirtschaftlich.
Du sorgst dafür, dass moderne Modelle nicht nur in einer Demo überzeugen, sondern unter realen Produktionsbedingungen zuverlässig funktionieren: mit sauberer GPU‑Planung, niedriger Latenz, kontrollierten Kosten, belastbarem Monitoring und klar definierten Betriebsmodellen.
Was erwartet dich- Du konzipierst, entwickelst und betreibst produktive LLM‑Inferenzplattformen für Kunden mit hohen Anforderungen an Datensouveränität, Sicherheit und Betriebskontrolle – on‑premises, in privaten Cloud‑Umgebungen oder souveränen europäischen Cloud‑Setups.
- Gemeinsam mit Cloud‑ , Plattform‑ , Security‑ und Data‑Engineering‑Teams sowie unseren Kunden überführst du AI‑Use‑Cases in den produktiven Betrieb.
- Dabei integrierst du moderne Inferenz‑Engines und Open‑Weights‑Modelle in Kubernetes‑, Container‑ und Plattformumgebungen.
- Außerdem planst und optimierst du GPU‑ und Speicherressourcen sowie Inferenz‑Workloads:
Von Modellgrößen, Quantisierung und Batching bis hin zu KV‑Cache‑Strategien, Latenz, Durchsatz und Kosten. - Du verantwortest die Runtime produktiver AI‑Systeme, inklusive Modellserving, APIs, Authentifizierung, Secrets, Observability, Logging
- Aus Kundenprojekten entwickelst du wiederverwendbare Referenzarchitekturen, Deployment‑Templates und Betriebs‑Playbooks und stärkst so unsere Applied‑AI‑Capability.
- Persönlicher Background: Erfahrung in Platform Engineering, Cloud Infrastructure, MLOps, LLMOps, Dev Ops, Backend Engineering oder Machine Learning Engineering. Entscheidend ist deine Erfahrung im Aufbau und Betrieb produktiver Systeme und dein Antrieb zu schneller persönlicher Weiterentwicklung
- Inference Engineering: Du verstehst die technischen und wirtschaftlichen Zusammenhänge moderner LLM‑Inferenz, von Model‑Serving und GPU‑Auslastung über Quantisierung, Batching und KV‑Cache‑Management bis hin zu Latenz, Durchsatz und Kosten.
- Cloud & Plattformen: Docker, Kubernetes, Helm, Terraform, CI/CD, Linux sowie Observability gehören für dich zum Arbeitsalltag.
- AI‑Verständnis:Du kannst Transformer‑basierte Modelle wie LLMs und Embeddings einordnen und fundierte technische Entscheidungen für produktive AI‑Systeme treffen.
- Security & Governance: Themen wie Identitäten, Berechtigungen, Secrets, Logging, Auditierung und Compliance denkst du, insbesondere in regulierten Umgebungen, von Anfang an mit.
- Kommunikation & Arbeitsweise: Du vermittelst komplexe technische Zusammenhänge verständlich, arbeitest pragmatisch und bewegst dich auch in dynamischen Projektumfeldern sicher.
- Pluspunkt: Erfahrung mit vLLM, SGLang oder vergleichbaren Inference‑Technologien, GPU‑Clustern, souveränen Cloud‑ oder Private‑Cloud‑Umgebungen.
- On the road: Du bist reisebereit und flexibel, unsere Kunden bundesweit vor Ort zu beraten.
- Let’s talk: Du sprichst fließend Deutsch und Englisch – super, dann findest du dich bei Exxeta bestens zurecht
To View & Apply for jobs on this site that accept applications from your location or country, tap the button below to make a Search.
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).
(If this job is in fact in your jurisdiction, then you may be using a Proxy or VPN to access this site, and to progress further, you should change your connectivity to another mobile device or PC).
Search for further Jobs Here:
×