Senior Site Reliability Engineer, Microsoft
Posted 6hrs ago
Employment Information
Report this job
Job expired or something wrong with this job?
Job Description
Senior Microsoft SRE engineering Azure, AKS, and automation platforms for Koniag’s federal government customers. Improving reliability, observability, security, and production operations.
Responsibilities:
- Design, configure, develop, integrate, test, document, and sustain Microsoft Azure capabilities
- Support Azure cloud platform engineering, AKS operations, infrastructure automation, CI/CD, observability, platform reliability, and AI-enabled delivery practices
- Improve reliability, observability, incident response, performance, capacity, and operational readiness
- Provide site reliability, production operations, and cloud platform engineering support for Microsoft Azure capabilities
- Implement and improve CI/CD pipelines, infrastructure as code, container platform operations, monitoring, alerting, and secure deployment automation
- Translate business, mission, security, accessibility, and operational requirements into practical technical solutions
- Support platform architecture, backlog refinement, implementation planning, release readiness, and production transition activities
- Develop reusable patterns, configuration standards, automation, documentation, and support procedures
- Troubleshoot complex issues across platform configuration, code, data, APIs, identity, security, performance, and user experience
- Collaborate with cybersecurity, privacy, data, infrastructure, QA, and change management teams
- Maintain technical documentation, design decisions, implementation notes, test evidence, and operational runbooks
- Work with government stakeholders, architects, engineers, product owners, cybersecurity, operations, and business users to deliver secure, reliable, accessible, and maintainable digital services
Requirements:
- Bachelor's degree in Computer Science, Information Systems, Software Engineering, Data Analytics, Cybersecurity, or a related discipline, or equivalent work experience
- 7+ years of experience in site reliability, production operations, and cloud platform engineering
- Hands-on experience with Microsoft Azure implementation, configuration, development, integration, testing, or operations
- Experience working with Agile delivery teams and translating stakeholder needs into maintainable technical outcomes
- Strong hands-on knowledge of Microsoft Azure capabilities, implementation patterns, administration, development, integration, and lifecycle management
- Ability to design and implement secure, supportable, upgrade-aware solutions
- Experience with APIs, identity and access controls, data management, testing, monitoring, troubleshooting, and release coordination
- Ability to document technical designs, configuration decisions, operational procedures, test results, and risks
- Ability to obtain a Public Trust clearance
- Experience with DevSecOps practices, CI/CD pipelines, automated testing, infrastructure as code, or platform release automation
- Knowledge of NIST controls, FISMA, FedRAMP-authorized services, audit evidence, and least privilege
- Experience improving platform governance, reuse, documentation, observability, and operational readiness
- Familiarity with Microsoft 365, ServiceNow, Atlassian, Snowflake, data catalog, CRM, or enterprise integration ecosystems
- Microsoft Azure or Kubernetes certification (desired)
Benefits:
- Health, dental and vision insurance
- 401K with company matching
- Flexible spending accounts
- Paid holidays
- Three weeks paid time off
- Extraordinary benefits package
- Competitive compensation












