Como evitar puntos unicos de falla en su sistema de comunicaciones
Un punto unico de falla es esa parte de su sistema cuya falla derriba todo lo demas con ella. En las comunicaciones de seguridad publica, esos eslabones debiles son faciles de pasar por alto hasta el peor momento posible. Esta guia le da a alguien sin formacion tecnica una forma practica de identificarlos, entenderlos y agregarles respaldo sin disparar el presupuesto.
- Que es realmente un punto unico de falla
- Donde se esconden en las comunicaciones de seguridad publica
- Cómo mapear sus dependencias
- La prueba de "que pasa si esto se cae"
- Cómo agregar respaldo de la forma correcta
- PACE: primario, alterno, de contingencia y de emergencia
- Probar la conmutacion y equilibrar el presupuesto
- Puntos clave
Que es realmente un punto unico de falla
Quitando la jerga tecnica, un punto unico de falla (a menudo llamado SPOF, por sus siglas en ingles) es algo simple: es una cosa cuya falla hace que todo lo demas se caiga con ella. Si una cadena tiene un eslabon debil, la fortaleza del resto de la cadena no importa. La cadena falla donde ese eslabon falla.
Los sistemas de comunicaciones son cadenas de dependencias. Entra una llamada, viaja por una red, llega a una posicion de despacho, se envia por un canal, llega a un radio en una unidad en movimiento y se confirma. Cada uno de esos pasos depende de que algo debajo funcione: energia, una ruta de senal, un equipo, una persona. Cuando cualquiera de esas cosas no tiene respaldo, es un punto unico de falla. Su falla no degrada el sistema. Lo detiene por completo.
La razon por la que los SPOF son peligrosos no es que fallen seguido. Es que fallan pocas veces, asi que nadie se prepara para el dia en que sucede. Un repetidor funciona anos sin problemas, y el departamento termina construyendo silenciosamente todo su ritmo operativo alrededor de la idea de que siempre estara ahi. Cuando finalmente falla, la falla es total y llega sin aviso.
Para cualquier parte de su sistema, hagase una sola pregunta: "Si esto dejara de funcionar ahora mismo, ¿podriamos seguir comunicandonos?" Si la respuesta honesta es no, encontro un punto unico de falla. No necesita un titulo de ingenieria para hacer esa pregunta. Solo necesita hacerla sobre cada parte del sistema.
Donde se esconden en las comunicaciones de seguridad publica
Los puntos unicos de falla en las comunicaciones de un departamento tienden a agruparse en un puñado de lugares predecibles. Repase esta lista contra su propia configuracion y sea honesto con cada punto.
- Un solo repetidor o una sola torre. Si un unico sitio lleva sus rutas de comunicacion principales y se cae, la cobertura colapsa. Un rayo, una falla de equipo o un error de una cuadrilla de mantenimiento de torres puede provocarlo.
- Un solo enlace de transporte (backhaul). La conexion que lleva el trafico entre su centro de despacho y un sitio de radio es facil de olvidar porque es invisible. Si depende de un unico enlace de microondas o de un unico circuito arrendado, ese enlace es un SPOF aunque los radios en si tengan respaldo.
- Una sola fuente de energia. Los sitios de radio y los centros de despacho que dependen solo de la energia de la red electrica quedaran sin funcionamiento en un corte. Incluso los sitios con planta electrica pueden tener un punto unico de falla si la planta no tiene un interruptor de transferencia automatico, un plan de combustible o una bateria que cubra el intervalo.
- Una sola posicion de despachador o una sola consola. Un centro con una unica posicion en funcionamiento, o una sola consola que controla los radios, significa que una falla de hardware o un empleado enfermo puede dejarlo sin capacidad de despachar.
- Un solo canal que carga todo. Cuando el trafico de despacho, tactico y de mando comparte un unico canal, ese canal es al mismo tiempo un cuello de botella y un SPOF. Si lo pierde, pierde todas las funciones a la vez.
- Un solo circuito de internet. A medida que mas herramientas dependen de la red (mapas, alertas, registros, lineas telefonicas entregadas por datos), una unica conexion de internet se convierte silenciosamente en algo de lo que depende toda la operacion.
- Una sola persona que conoce el sistema. Este es el SPOF que a los departamentos les cuesta admitir. Si exactamente una persona entiende como esta programado el sistema de radio, donde estan las contraseñas y a quien llamar cuando algo falla, esa persona es un punto unico de falla que ademas es humano. Vacaciones, jubilaciones y malos dias aplican por igual.
Note que no todo esto es tecnologia. Las personas y el conocimiento tambien son dependencias, y fallan a su propia manera.
Cómo mapear sus dependencias
No puede eliminar un eslabon debil que nunca ha identificado. Lo mas util que puede hacer un departamento es sentarse a mapear sus dependencias de comunicaciones en papel. Esto no requiere software especial ni un consultor. Requiere un tablero y honestidad.
Comience por el resultado que le importa y trabaje hacia atras. Tome un escenario sencillo: una persona llama, contacta al despacho y una unidad es notificada y responde. Ahora liste cada cosa distinta que tiene que funcionar para que eso pase, en orden:
- La linea telefonica o ruta de llamada hacia el centro.
- El despachador y la posicion en la que trabaja.
- La consola o punto de control que activa el radio.
- El enlace desde el centro hacia el sitio de radio.
- La energia en el centro y la energia en el sitio.
- El repetidor y la antena en el sitio.
- El canal por donde viaja el trafico.
- Los radios portatiles y moviles en el campo.
Para cada elemento, anote que lo respalda. Si la casilla bajo "respaldo" queda en blanco, encontro un punto unico de falla y lo marco en el mismo momento. Este es todo el ejercicio. El mapa no es la meta. Las casillas en blanco son la meta.
Un mapa de dependencias solo sirve si refleja la realidad. Los sistemas cambian: se actualiza un circuito, se agrega un sitio, se da de baja una planta electrica de respaldo y nunca se reemplaza. Revise el mapa al menos una vez al año y cada vez que cambie infraestructura. Un mapa que describe el sistema que tenia hace tres años le mentira en el peor momento.
La prueba de "que pasa si esto se cae"
Una vez que tenga el mapa, aplique un ejercicio deliberadamente pesimista sobre el. Revise elemento por elemento y hagase la pregunta: ¿que pasa si esto se cae ahora mismo, en medio de una tarde de mucho trabajo? No lo suavice. No asuma que alguien lo notara rapido. Imagine el escenario completo.
Para cada dependencia, anote tres cosas:
- El efecto inmediato. ¿Que deja de funcionar en el instante en que esto falla? Sea especifico. "Perdemos el despacho en la zona norte" es util. "Las cosas se complican" no lo es.
- La alternativa, si existe. ¿Que hace realmente la gente en ese momento? Si la respuesta es "ya veriamos como resolverlo", eso no es una alternativa. Eso es un vacio.
- El tiempo de recuperacion. ¿Cuanto tiempo pasa hasta que el servicio normal vuelve? Minutos, horas o dias cambia por completo cuanto respaldo merece ese enlace.
Este ejercicio cumple dos funciones a la vez. Muestra las fallas que mas dañarian y las separa de las que se pueden tolerar. No todo SPOF merece que se gaste dinero para eliminarlo. Un eslabon debil que causa una molestia de dos minutos y un eslabon debil que deja a medio condado sin despacho por un dia no son el mismo problema, y tratarlos igual desperdicia un presupuesto limitado.
Cómo agregar respaldo de la forma correcta
Eliminar un punto unico de falla significa darle al sistema una segunda forma de funcionar cuando la primera falla. Eso es el respaldo. El truco esta en agregarlo en los lugares correctos y en las cantidades correctas. Unos cuantos patrones cubren la mayoria de lo que necesita un departamento.
- Energia de respaldo. Baterias para cubrir cortes cortos, una planta electrica con interruptor de transferencia automatico y un plan real de combustible para los cortes largos. La energia es la dependencia que esta debajo de todas las demas, por lo que merece respaldo primero.
- Rutas alternas. Una segunda ruta de transporte, un segundo sitio que pueda asumir la carga, o un segundo circuito de internet de un proveedor genuinamente distinto. La palabra "distinto" importa. Dos circuitos que comparten el mismo cable fisico enterrado son un solo circuito con dos facturas.
- Respaldo directo y en modo simplex. Cuando la infraestructura desaparece, los radios que pueden comunicarse de unidad a unidad sin repetidor mantienen coordinada a la cuadrilla en la escena. El modo simplex tiene alcance corto y no ayuda con la cobertura, pero funciona cuando todo lo demas esta caido. Asegurese de que las cuadrillas conozcan los canales de respaldo y realmente los hayan usado.
- Un modo manual documentado. Algunas fallas se enfrentan mejor no con mas equipo sino con un procedimiento escrito. Si el despacho se cae, ¿como se comunican las unidades directamente? Si se pierde un canal, ¿a cual se mueven? Un modo manual que solo vive en la cabeza de un veterano es en si mismo un punto unico de falla.
- Personal con formacion cruzada. El SPOF humano se elimina de la misma manera que cualquier otro: con una segunda via. Mas de una persona deberia saber como esta construido el sistema, donde estan las credenciales y a quien llamar. Documentelo y asegurese de que un segundo par de manos realmente haya hecho el trabajo, no solo leido sobre el.
El respaldo falla cuando dos rutas "independientes" en secreto comparten un eslabon debil. Un sitio de radio primario y uno de respaldo que reciben energia de la misma subestacion no son independientes. Dos circuitos de red que terminan en el mismo equipo no son independientes. Cuando agregue un respaldo, rastreelo hasta el final y confirme que no depende de lo mismo que se supone debe proteger.
PACE: primario, alterno, de contingencia y de emergencia
Los planificadores de seguridad publica y militares usan un marco simple para la resiliencia de las comunicaciones llamado PACE. Significa primario, alterno, de contingencia y de emergencia, y obliga a planear no solo un respaldo sino una escalera descendente de respaldos.
- Primario es el metodo que usa todos los dias cuando todo funciona.
- Alterno es un metodo distinto que cumple aproximadamente la misma funcion con poca perdida, usado cuando el primario no esta disponible.
- De contingencia es un metodo menos practico y posiblemente mas lento, pero que aun asi hace llegar el mensaje cuando los dos anteriores ya no funcionan.
- De emergencia es el ultimo recurso, el metodo de capacidad minima absoluta al que se recurre cuando todo lo demas ha fallado.
El poder de PACE esta en que lo obliga a definir el respaldo del respaldo. No basta con decir "tenemos un respaldo". PACE pregunta que pasa cuando el respaldo tambien falla, y luego otra vez despues de eso. Aplicado a una ruta de comunicacion, el metodo primario podria ser el canal troncalizado o repetido, el alterno un segundo canal o sitio, la contingencia el modo simplex de radio a radio, y la emergencia un metodo celular o telefonico como ultimo piso. Escriba el plan PACE para cada funcion critica, y asegurese de que las cuadrillas sepan en que escalon estan y como subir al siguiente.
Un plan PACE archivado en una carpeta que nadie lee es solo decoracion. El valor llega cuando un bombero o TUM en el campo sabe, sin que se lo digan, a que recurrir cuando el metodo primario se queda en silencio. Incorpore el plan a la capacitacion y repitalo hasta que la alternativa sea un reflejo, no una decision tomada bajo presion.
Probar la conmutacion y equilibrar el presupuesto
Un respaldo que nunca se ha probado es una esperanza, no un plan. La forma mas comun en que los respaldos fallan es que se instalaron, se marcaron como listos y nunca se pusieron a prueba. La planta electrica que no enciende. El circuito de respaldo mal configurado hace años. El canal simplex que nadie ha activado nunca. Estos problemas se detectan en una prueba programada o se detectan en una emergencia real, y solo una de esas opciones es sobrevivible.
Pruebe la conmutacion de forma deliberada y con un calendario. Desconecte el metodo primario a proposito, en una ventana controlada, y confirme que el sistema pasa al alterno tal como dice el plan. Luego siga bajando por la escalera PACE. Cronometrelo. Anote que fallo. Arreglelo y pruebe de nuevo. Una conmutacion que funciona en el papel pero que toma cuarenta y cinco minutos y tres llamadas telefonicas para activarse no es la conmutacion que usted creia tener.
Todo esto choca con la restriccion real: el presupuesto. El respaldo cuesta dinero, y un departamento no puede darse el lujo de duplicar todo. Por eso el mapeo y el ejercicio de "que pasa si esto se cae" van primero. Le indican que puntos unicos de falla causarian un daño real y cuales son solo una molestia, para que gaste los recursos limitados en los enlaces que mas importan. La resiliencia no consiste en eliminar cada punto debil. Consiste en asegurarse de que las fallas que mas daño causarian tengan una segunda via, y en aceptar las pequeñas con los ojos abiertos.
Puntos clave
- Un punto unico de falla es algo cuya falla hace que todo lo demas se caiga con ella. Encuentrelos preguntando, sobre cada parte, "si esto se cayera ahora mismo, ¿podriamos seguir comunicandonos?"
- Se agrupan en lugares predecibles: una torre, un enlace de transporte, una fuente de energia, una consola, un canal, un circuito de internet y una persona que conoce el sistema.
- Mapee sus dependencias en papel y marque cada casilla de respaldo que quede en blanco. Las casillas en blanco son sus SPOF.
- Aplique la prueba pesimista de "que pasa si esto se cae" para separar las fallas que dañarian de las que se pueden tolerar.
- Agregue respaldo donde realmente importa: energia de respaldo, rutas alternas verdaderamente independientes, modo simplex, un modo manual documentado y personal con formacion cruzada.
- Use PACE (primario, alterno, de contingencia y de emergencia) para planear el respaldo del respaldo, y capacite a las cuadrillas hasta que sea un reflejo.
- Pruebe la conmutacion antes de necesitarla, y gaste su presupuesto limitado en los eslabones debiles que causarian mas daño, no en eliminar todos y cada uno.
La resiliencia depende de una documentacion que se mantenga actualizada y facil de encontrar. RunBoard le da a un departamento un solo lugar organizado para guardar sus mapas de dependencias, planes PACE, registros de pruebas de conmutacion, y los datos de contacto y credenciales que de otro modo vivirian en la cabeza de una sola persona. Cuando el metodo primario se queda en silencio, el plan y los registros estan al alcance de todos, no encerrados detras de lo unico que acaba de fallar.