Como evitar puntos unicos de falla en su sistema de comunicaciones

Un punto unico de falla es esa parte de su sistema cuya falla derriba todo lo demas con ella. En las comunicaciones de seguridad publica, esos eslabones debiles son faciles de pasar por alto hasta el peor momento posible. Esta guia le da a alguien sin formacion tecnica una forma practica de identificarlos, entenderlos y agregarles respaldo sin disparar el presupuesto.

En esta guia
  1. Que es realmente un punto unico de falla
  2. Donde se esconden en las comunicaciones de seguridad publica
  3. Cómo mapear sus dependencias
  4. La prueba de "que pasa si esto se cae"
  5. Cómo agregar respaldo de la forma correcta
  6. PACE: primario, alterno, de contingencia y de emergencia
  7. Probar la conmutacion y equilibrar el presupuesto
  8. Puntos clave

Que es realmente un punto unico de falla

Quitando la jerga tecnica, un punto unico de falla (a menudo llamado SPOF, por sus siglas en ingles) es algo simple: es una cosa cuya falla hace que todo lo demas se caiga con ella. Si una cadena tiene un eslabon debil, la fortaleza del resto de la cadena no importa. La cadena falla donde ese eslabon falla.

Los sistemas de comunicaciones son cadenas de dependencias. Entra una llamada, viaja por una red, llega a una posicion de despacho, se envia por un canal, llega a un radio en una unidad en movimiento y se confirma. Cada uno de esos pasos depende de que algo debajo funcione: energia, una ruta de senal, un equipo, una persona. Cuando cualquiera de esas cosas no tiene respaldo, es un punto unico de falla. Su falla no degrada el sistema. Lo detiene por completo.

La razon por la que los SPOF son peligrosos no es que fallen seguido. Es que fallan pocas veces, asi que nadie se prepara para el dia en que sucede. Un repetidor funciona anos sin problemas, y el departamento termina construyendo silenciosamente todo su ritmo operativo alrededor de la idea de que siempre estara ahi. Cuando finalmente falla, la falla es total y llega sin aviso.

La prueba en palabras simples

Para cualquier parte de su sistema, hagase una sola pregunta: "Si esto dejara de funcionar ahora mismo, ¿podriamos seguir comunicandonos?" Si la respuesta honesta es no, encontro un punto unico de falla. No necesita un titulo de ingenieria para hacer esa pregunta. Solo necesita hacerla sobre cada parte del sistema.

Donde se esconden en las comunicaciones de seguridad publica

Los puntos unicos de falla en las comunicaciones de un departamento tienden a agruparse en un puñado de lugares predecibles. Repase esta lista contra su propia configuracion y sea honesto con cada punto.

Note que no todo esto es tecnologia. Las personas y el conocimiento tambien son dependencias, y fallan a su propia manera.

Cómo mapear sus dependencias

No puede eliminar un eslabon debil que nunca ha identificado. Lo mas util que puede hacer un departamento es sentarse a mapear sus dependencias de comunicaciones en papel. Esto no requiere software especial ni un consultor. Requiere un tablero y honestidad.

Comience por el resultado que le importa y trabaje hacia atras. Tome un escenario sencillo: una persona llama, contacta al despacho y una unidad es notificada y responde. Ahora liste cada cosa distinta que tiene que funcionar para que eso pase, en orden:

Para cada elemento, anote que lo respalda. Si la casilla bajo "respaldo" queda en blanco, encontro un punto unico de falla y lo marco en el mismo momento. Este es todo el ejercicio. El mapa no es la meta. Las casillas en blanco son la meta.

Mantenga el mapa actualizado

Un mapa de dependencias solo sirve si refleja la realidad. Los sistemas cambian: se actualiza un circuito, se agrega un sitio, se da de baja una planta electrica de respaldo y nunca se reemplaza. Revise el mapa al menos una vez al año y cada vez que cambie infraestructura. Un mapa que describe el sistema que tenia hace tres años le mentira en el peor momento.

La prueba de "que pasa si esto se cae"

Una vez que tenga el mapa, aplique un ejercicio deliberadamente pesimista sobre el. Revise elemento por elemento y hagase la pregunta: ¿que pasa si esto se cae ahora mismo, en medio de una tarde de mucho trabajo? No lo suavice. No asuma que alguien lo notara rapido. Imagine el escenario completo.

Para cada dependencia, anote tres cosas:

Este ejercicio cumple dos funciones a la vez. Muestra las fallas que mas dañarian y las separa de las que se pueden tolerar. No todo SPOF merece que se gaste dinero para eliminarlo. Un eslabon debil que causa una molestia de dos minutos y un eslabon debil que deja a medio condado sin despacho por un dia no son el mismo problema, y tratarlos igual desperdicia un presupuesto limitado.

Cómo agregar respaldo de la forma correcta

Eliminar un punto unico de falla significa darle al sistema una segunda forma de funcionar cuando la primera falla. Eso es el respaldo. El truco esta en agregarlo en los lugares correctos y en las cantidades correctas. Unos cuantos patrones cubren la mayoria de lo que necesita un departamento.

Cuidado con las dependencias compartidas ocultas

El respaldo falla cuando dos rutas "independientes" en secreto comparten un eslabon debil. Un sitio de radio primario y uno de respaldo que reciben energia de la misma subestacion no son independientes. Dos circuitos de red que terminan en el mismo equipo no son independientes. Cuando agregue un respaldo, rastreelo hasta el final y confirme que no depende de lo mismo que se supone debe proteger.

PACE: primario, alterno, de contingencia y de emergencia

Los planificadores de seguridad publica y militares usan un marco simple para la resiliencia de las comunicaciones llamado PACE. Significa primario, alterno, de contingencia y de emergencia, y obliga a planear no solo un respaldo sino una escalera descendente de respaldos.

El poder de PACE esta en que lo obliga a definir el respaldo del respaldo. No basta con decir "tenemos un respaldo". PACE pregunta que pasa cuando el respaldo tambien falla, y luego otra vez despues de eso. Aplicado a una ruta de comunicacion, el metodo primario podria ser el canal troncalizado o repetido, el alterno un segundo canal o sitio, la contingencia el modo simplex de radio a radio, y la emergencia un metodo celular o telefonico como ultimo piso. Escriba el plan PACE para cada funcion critica, y asegurese de que las cuadrillas sepan en que escalon estan y como subir al siguiente.

PACE solo es real si las cuadrillas lo conocen

Un plan PACE archivado en una carpeta que nadie lee es solo decoracion. El valor llega cuando un bombero o TUM en el campo sabe, sin que se lo digan, a que recurrir cuando el metodo primario se queda en silencio. Incorpore el plan a la capacitacion y repitalo hasta que la alternativa sea un reflejo, no una decision tomada bajo presion.

Probar la conmutacion y equilibrar el presupuesto

Un respaldo que nunca se ha probado es una esperanza, no un plan. La forma mas comun en que los respaldos fallan es que se instalaron, se marcaron como listos y nunca se pusieron a prueba. La planta electrica que no enciende. El circuito de respaldo mal configurado hace años. El canal simplex que nadie ha activado nunca. Estos problemas se detectan en una prueba programada o se detectan en una emergencia real, y solo una de esas opciones es sobrevivible.

Pruebe la conmutacion de forma deliberada y con un calendario. Desconecte el metodo primario a proposito, en una ventana controlada, y confirme que el sistema pasa al alterno tal como dice el plan. Luego siga bajando por la escalera PACE. Cronometrelo. Anote que fallo. Arreglelo y pruebe de nuevo. Una conmutacion que funciona en el papel pero que toma cuarenta y cinco minutos y tres llamadas telefonicas para activarse no es la conmutacion que usted creia tener.

Todo esto choca con la restriccion real: el presupuesto. El respaldo cuesta dinero, y un departamento no puede darse el lujo de duplicar todo. Por eso el mapeo y el ejercicio de "que pasa si esto se cae" van primero. Le indican que puntos unicos de falla causarian un daño real y cuales son solo una molestia, para que gaste los recursos limitados en los enlaces que mas importan. La resiliencia no consiste en eliminar cada punto debil. Consiste en asegurarse de que las fallas que mas daño causarian tengan una segunda via, y en aceptar las pequeñas con los ojos abiertos.

Puntos clave

Donde encaja RunBoard

La resiliencia depende de una documentacion que se mantenga actualizada y facil de encontrar. RunBoard le da a un departamento un solo lugar organizado para guardar sus mapas de dependencias, planes PACE, registros de pruebas de conmutacion, y los datos de contacto y credenciales que de otro modo vivirian en la cabeza de una sola persona. Cuando el metodo primario se queda en silencio, el plan y los registros estan al alcance de todos, no encerrados detras de lo unico que acaba de fallar.