Kafka Specialist
Listed on 2026-07-22
-
IT/Tech
Cloud Computing: Infrastructure & Operations, SRE/Site Reliability, Systems Engineer, IT Infrastructure
We are seeking an experienced Technology Specialist – Kafka to design, administer, automate, secure, and optimise enterprise Kafka platforms supporting mission-critical banking applications.
This role is responsible for ensuring the stability, scalability, resilience, and security of Kafka environments while driving automation, Dev Ops best practices, and cloud adoption.
The successful candidate will combine deep Kafka platform engineering expertise with Linux administration, Infrastructure-as-Code, observability, and cloud engineering to deliver highly available event streaming infrastructure that supports modern banking systems and real-time data integration.
Key Responsibilities Kafka Platform Administration- Install, configure, upgrade, patch and maintain enterprise Kafka clusters.
- Administer Confluent Platform and/or Confluent Cloud environments.
- Manage brokers, topics, partitions, replication and consumer groups.
- Optimise Kafka cluster performance, throughput and latency.
- Perform capacity planning and scaling of Kafka infrastructure.
- Troubleshoot broker failures, replication issues and performance bottlenecks.
- Support production incidents and perform root cause analysis.
- Design highly available Kafka platforms across multiple environments.
- Implement resilient architectures for business-critical messaging workloads.
- Configure multi-broker clusters with appropriate replication and fault tolerance.
- Support disaster recovery and high availability strategies.
- Maintain platform documentation and operational runbooks.
Develop and maintain automation to reduce manual operational effort.
Responsibilities include:
- Infrastructure as Code
- Platform provisioning
- Automated deployments
- Configuration management
- CI/CD integration
- Environment standardisation
Typical technologies include:
- Terraform
- Ansible
- Python
- Bash
- Azure Dev Ops
- Git
Provide specialist Linux administration supporting Kafka infrastructure.
Responsibilities include:
- Performance tuning
- Storage optimisation
- Network troubleshooting
- Service management
- Operating system maintenance
- Capacity management
- Log analysis
Design and maintain secure Kafka environments.
Responsibilities include:
- TLS/SSL encryption
- SASL authentication
- ACL administration
- Certificate lifecycle management
- Identity integration
- Secure client connectivity
- Compliance with enterprise security standards
Support Kafka deployments across cloud platforms, with a focus on Microsoft Azure.
Responsibilities include:
- Azure networking
- Virtual Machines
- Managed services
- Storage
- Identity integration
- Hybrid deployments
- Cloud security
- Platform optimisation
Experience with Confluent Cloud is highly advantageous.
Monitoring & ObservabilityBuild comprehensive monitoring and operational visibility across Kafka platforms.
Responsibilities include:
- Health monitoring
- Performance dashboards
- Alerting
- Capacity monitoring
- Log aggregation
- Distributed tracing
- Incident diagnostics
Typical tools include:
- Prometheus
- Grafana
- ELK Stack
- Splunk
- Azure Monitor
- Support production platforms within SLA.
- Lead technical investigations.
- Perform root cause analysis.
- Recommend permanent fixes.
- Participate in major incident resolution.
- Drive platform stability improvements.
Work closely with:
- Platform Engineers
- Dev Ops Engineers
- Infrastructure Teams
- Cloud Engineers
- Security Teams
- Application Developers
- Architecture Teams
- Operations Teams
- 6+ years' experience in Systems Engineering, Platform Engineering or Infrastructure Engineering.
- 4+ years' hands‑on Kafka administration.
- Enterprise production support experience.
- Experience supporting highly available distributed systems.
- Experience automating infrastructure and operational processes.
- Experience working within Dev Ops environments.
- Apache Kafka
- Confluent Platform
- Confluent Cloud
- Broker administration
- Topic management
- Consumer groups
- Partition management
- Replication
- Cluster upgrades
- Performance tuning
- Capacity planning
- Python
- Bash
- Terraform
- Ansible
- CI/CD Pipelines
- Azure Dev Ops
- Git
- Linux Administration
- Shell scripting
- Performance tuning
- System troubleshooting
To Search, View & Apply for jobs on this site that accept applications from your location or country, tap here to make a Search: