Jump to content

User:SGrabarczuk (WMF)/Site Reliability Engineering

From mediawiki.org

As Site Reliability Engineering, we are in charge of making sure all Wikimedia's sites and services used by the public (including MediaWiki and all associated services) run reliably, securely, and with high performance.

Notify us of emergencies with Klaxon.



About us

Would be nice to add something here about SRE as a whole.



Leadership

Mark Bergsma

Vice President, Site Reliability Engineering

Kavitha Appakayala

Director, Site Reliability Engineering

Brandon Black

Principal Site Reliability Engineer

Giuseppe Lavagetto

Principal Site Reliability Engineer



Teams

Collaboration Services

[edit]

We are responsible for building and maintaining the infrastructure aspects of the source code management, CI and CD, task and ticket management systems as well as hosting non-MediaWiki websites and other collaboration services.

Lukasz Sobanski

Manager, Site Reliability Engineering

Daniel Zahn

Senior Site Reliability Engineer

Jelto Wodstrcil

Senior Site Reliability Engineer

Arnold Okoth

Site Reliability Engineer II

Arnaud Bran

Senior Site Reliability Engineer

Data Center Operations

[edit]

We are responsible for all of Wikimedia's data center deployments and logistics as well as maintaining our presence in locations across the world. We perform on-site work and maintain the full 5-year life cycle (specs, purchasing, physical install, break/fix and decommissioning) for all hardware.

#wikimedia-dcops connect

Willy Pao

Senior Engineering Manager

Rob Halsell

Senior Data Center Engineer

Papaul Tshibamba

Lead Data Center Engineer

John Clark

Data Center Engineer

Valerie Riley

Data Center Engineer

Jenn Hancock

Data Center Engineer

Data Persistence

[edit]

We focuse on Wikimedia's persistent data storage and retrieval systems, including (No)SQL databases, (distributed) object storage, file storage and backup systems.

#wikimedia-data-persistence connect

Kwaku Addo Ofori

Senior Engineering Manager

Manuel Arostegui

Staff Database Administrator

Jaime Crespo

Senior Database Administrator

Eric Evans

Staff Software Engineer

Amir Sarabadani

Staff Database Architect

Matthew Vernon

Senior Site Reliability Engineer

Federico Ceratto

Senior Site Reliability Engineer

Infrastructure Foundations

[edit]

We focus on building and maintaining our base platform (“metal cloud”) that forms the foundations upon which nearly everything else in our infrastructure builds upon. On top of our bare metal deployments, their responsibilities include (but are not limited to) configuration management systems, infrastructure automation, orchestration tooling, infrastructure security and network operations.

#wikimedia-sre-foundations connect

Lukasz Sobanski

Manager, Site Reliability Engineering

Moritz Mühlenhoff

Staff Site Reliability Engineer

Chris Danis

Staff Site Reliability Engineer

Arzhel Younsi

Staff Site Reliability Engineer

Cathal Mooney

Staff Site Reliability Engineer

Jesse Hathaway

Staff Site Reliability Engineer

Simon Lyngshede

Site Reliability Engineer

Luca Toscano

Staff Site Reliability Engineer

Observability

[edit]

We provide teams with diagnostic tools, platforms, and insights into how systems and services perform. We leverage technologies such as Grafana, Kibana/Logstash, OpenSearch, Prometheus, AlertManager and more.

#wikimedia-observability connect #wikimedia-serviceops connect

Hugh Nowlan

Site Reliability Engineering Manager

Keith Herron

Senior Site Reliability Engineer

Cole White

Senior Site Reliability Engineer

Andrea Denisse Gómez-Martínez

Site Reliability Engineer

Tiziano Fogli

Site Reliability Engineer

Service Operations

[edit]

We take care of public and “user-visible” services in close collaboration with the P&T teams. This includes our MediaWiki platform and the SOA service infrastructure based on Kubernetes.

#wikimedia-serviceops connect

Matthieu Lec'hvien

Site Reliability Manager

Blake Jensen

Senior Site Reliability Engineer

Reuven Lazarus

Staff Site Reliability Engineer

Effie Mouzeli

Senior Site Reliability Engineer

Janis Meybohm

Senior Site Reliability Engineer

Clément Goubert

Senior Site Reliability Engineer

Raine Souček

Senior Site Reliability Engineer

Scott French

Senior Site Reliability Engineer

Jasmine Kilani

Site Reliability Engineer II

Tools Infrastructure

[edit]

We provide support and infrastructure for Toolforge and the Tools Platform team. We also maintain several other cloud services, including cloud-vps.

Riccardo Coccioli

Staff Site Reliability Engineer

Andrew Bogott

Staff Site Reliability Engineer

Filippo Giunchedi

Staff Site Reliability Engineer

Taavi Väänänen

Site Reliability Engineer

Traffic

[edit]

We are responsible for the critical first layer of high-traffic infrastructure which now spans much of the globe, including our TLS termination and caching layers (ATS, Varnish), load balancing, DNS and our own network.

#wikimedia-traffic connect

Sukhbir Singh

Site Reliability Engineering Manager

Kwaku Addo Ofori

Senior Engineering Manager

Brett Cornwall

Site Reliability Engineer III

Fabrizio Furnari

Senior Site Reliability Engineer

Valentin Gutierrez

Staff Site Reliability Engineer

Christopher Dobbins

Site Reliability Engineer



Contact