Status

Todos os sistemas operacionais.

Os cinco componentes estão cumprindo suas metas agora: a API, o provisionamento, os pagamentos, os dados de cobertura e o suporte. Se isso mudar, esta página muda em até cinco minutos depois de o incidente ser declarado, e se der para saber quem foi afetado a gente já vai ter falado com você antes de você ler aqui.

Uma página de status só vale alguma coisa se estiver disposta a dizer algo ruim. Esta aqui é atualizada durante o incidente, não depois, o que significa que às vezes você vai ver a palavra investigando do lado de um componente enquanto a gente ainda não sabe por quê.

Componentes

ComponenteEstadoMetaAgora
APIOperacional99,9 por cento de disponibilidadeNenhum erro acima da linha de base nas últimas 24 horas
ProvisionamentoOperacional99,5 por cento dos pedidos pagos chegam a um perfil funcionandoA hora móvel está acima da meta, instalação mediana de 41 segundos
PagamentosOperacionalAutorização e reembolso automático em menos de 60 segundosO processador reporta normalidade e os reembolsos estão saindo no prazo
Dados de coberturaOperacionalNúmeros publicados atualizados todo dia, com o piso de 25 amostras mantidoA última atualização terminou e nenhum país está oculto por dado velho
SuporteOperacionalPrimeira resposta em menos de 60 segundos, 24 horas por diaA fila está dentro da meta em todos os idiomas atendidos

Operacional quer dizer que o componente está cumprindo a meta na hora móvel. Não é uma promessa sobre a próxima hora.

99,5%

meta de sucesso no provisionamento

60 s

reembolso automático quando o provisionamento falha

30 min

duração de incidente que obriga a um post mortem público

72 h

prazo para publicar esse post mortem

O que significa cada estado

EstadoO que significaO que fazemos
OperacionalO componente está cumprindo a meta na hora móvelNada. É o estado normal e não é uma promessa sobre o futuro
Desempenho degradadoFuncionando, mas mais lento ou menos confiável que a metaCitado nesta página, clientes afetados avisados, créditos aplicados sem ninguém pedir
Interrupção parcialFalhando para um grupo identificável, como uma operadora ou uma regiãoO grupo é citado, as compras são bloqueadas onde falhariam, os reembolsos disparam sozinhos
Interrupção totalFalhando de forma amplaUm comandante do incidente é nomeado e as atualizações saem pelo menos a cada 30 minutos até resolver
ManutençãoTrabalho planejado com janela conhecidaAnunciada com pelo menos 72 horas de antecedência e agendada na hora de menor tráfego

Não existe um estado que signifique bem, provavelmente. Ou o componente está cumprindo a meta, ou ele está citado nesta página.

A política de incidentes

Dois compromissos seguram tudo isso, e os dois são incômodos de propósito. O primeiro é que a gente avisa os clientes afetados antes de eles perceberem. O segundo é que tudo que passa de 30 minutos ganha um post mortem escrito e publicado em até 72 horas.

O post mortem cita sistemas e decisões, não funcionários específicos, e quem escreve é quem estava de plantão, não um gestor descrevendo outra pessoa.

Se a gente for furar o prazo de 72 horas, publica o atraso e o motivo dentro dessas 72 horas, porque um prazo furado e anunciado tarde são duas falhas.

  • A detecção é automática, a partir das taxas de sucesso no provisionamento e de autorização de pagamento, então um incidente começa quando os números se mexem e não quando alguém reclama
  • O estado do componente nesta página muda em até cinco minutos depois da declaração, antes de a causa ser conhecida
  • Um comandante do incidente conduz a resposta e outra pessoa cuida da comunicação, para que nenhuma das duas funções sufoque a outra
  • Os clientes afetados são identificados e avisados, com o crédito já aplicado onde o serviço ficou degradado, em vez de oferecido só a quem pedir
  • As compras são bloqueadas em qualquer caminho em que sabemos que falhariam, porque pegar um dinheiro que vamos ter que devolver é pior que perder a venda
  • Durante uma interrupção total sai uma atualização pelo menos a cada 30 minutos, mesmo quando a atualização é que ainda não sabemos
  • Em até 72 horas depois da resolução sai um post mortem com a linha do tempo, o impacto em clientes em números, a causa, e cada correção com responsável e data
Seu celular
Operadora Acongestionada, 4 Mbps
Operadora Blivre, 61 Mbps
Trocado, sem te perguntar
Quem trabalha com uma operadora só não consegue fazer isso. É exatamente por isso que compramos de mais de uma.
Quando um território tem mais de uma rede parceira, o congestionamento troca a sua rede em vez de virar um incidente.

Por que a meta não é cem por cento

Porque tem uma rede no meio e cem por cento seria mentira. Uma meta de 99,5 por cento no provisionamento diz em voz alta que cerca de cinco pedidos em mil vão falhar em algum ponto entre o pagamento e o perfil funcionando.

O que importa é que o caminho desses cinco esteja desenhado. O reembolso dispara em menos de 60 segundos sem abrir chamado, a mensagem explica o que aconteceu e o que tentar no lugar, e ninguém precisa decidir se o cliente merece.

A mesma lógica vale para a cobertura. Quando uma rede parceira está congestionada num território em que temos mais de uma operadora, a gente troca a sua rede em vez de registrar um incidente, e a nota diz qual troca foi feita.

Quando só existe uma rede e ela está num dia ruim, a gente diz isso na página do país. Nossas páginas de cobertura publicam a mediana, o décimo mais lento e o número de amostras exatamente por causa disso.

Histórico de incidentes

Nenhum incidente acima de 30 minutos foi declarado no período coberto por este relatório.

Essa frase vale exatamente o quanto valer a nossa disposição de mudá-la, e é por isso que a política acima está escrita com esse tanto de detalhe. Todo post mortem antigo continua publicado para sempre, em vez de sumir depois de noventa dias.

Perguntas que as pessoas realmente fazem

O que operacional quer dizer aqui, na prática?
Que o componente está cumprindo a meta agora, não que nunca deu problema. O provisionamento está operacional quando os pedidos pagos chegam a perfis funcionando na meta de 99,5 por cento ou acima dela, medido na hora móvel.
Com que rapidez esta página atualiza durante um incidente?
O estado do componente muda em até cinco minutos depois de o incidente ser declarado, antes de sabermos a causa. Isso significa que às vezes você vai ler investigando em vez de uma explicação. Preferimos chegar cedo e vagos a chegar tarde e arrumadinhos.
Vocês me avisam ou eu tenho que ficar de olho nesta página?
A gente avisa. Se conseguirmos identificar quem foi afetado, você ouve da gente antes de perceber, com o crédito já aplicado. Esta página existe para todo mundo mais e para quem quer o detalhe.
Quando vocês publicam um post mortem?
Em até 72 horas para qualquer incidente que passe de 30 minutos. Ele traz a linha do tempo, o impacto em clientes em números, a causa, e as correções com responsáveis e datas. Se a gente for atrasar a publicação, publica no prazo o atraso e o motivo.
E se eu não conseguir abrir esta página porque estou sem dados?
Esse é justamente o caso em torno do qual o produto inteiro foi construído. Toda conta tem 100 MB por mês de dados de emergência grátis em 145 países, então você consegue abrir esta página, falar com o suporte e comprar um plano mesmo com o saldo zerado. O suporte responde em menos de 60 segundos, a qualquer hora.
Problemas de operadora em um país aparecem aqui?
Aparecem, como dados de cobertura com desempenho degradado e o país citado. Onde nossos parceiros têm mais de uma rede num território, a gente troca você para a operadora mais limpa sem perguntar, e a nota do incidente diz qual troca foi feita.