Come si misura l’affidabilità di una rete: MTBF, disponibilità, SLA e collaudo

In breve. L’affidabilità di una rete si misura con tre numeri che vengono spesso confusi: l’MTBF (Mean Time Between Failures, tempo medio fra i guasti) dice ogni quanto, in media, si guasta un apparato; l’MTTR (Mean Time To Repair, tempo medio di ripristino) dice quanto si impiega a ripararlo; la disponibilità dice per quale parte del tempo il servizio funziona davvero. L’SLA (Service Level Agreement, accordo sul livello di servizio) è la promessa scritta su quei numeri, e vale quanto le sue esclusioni. Una disponibilità del 99,9 per cento vuol dire quasi nove ore di fermo all’anno; del 99,99 per cento, meno di un’ora. Per arrivarci contano più il tempo di riparazione, la ridondanza e il collaudo del failover che l’MTBF scritto sulla scheda tecnica.

Questa guida è scritta da Netframe, system integrator IT con sede a Modena, per chi deve valutare una rete aziendale o industriale, scrivere un capitolato o leggere un contratto di assistenza. Qui “affidabilità” vuol dire la continuità del servizio di rete per chi lo usa, non l’affidabilità di un software o di un singolo prodotto.

Tre numeri che si confondono

Termine Cosa misura Chi lo fornisce L’errore tipico
MTBF (tempo medio fra i guasti) Ogni quante ore, in media, si guasta un apparato di un certo modello Il produttore, con un calcolo statistico Leggerlo come durata: 500.000 ore non vuol dire che lo switch dura 57 anni
MTTR (tempo medio di ripristino) Quanto passa da un guasto al servizio di nuovo funzionante L’organizzazione: ricambi, contratto, persone, documentazione Confonderlo con il tempo di intervento del fornitore
Disponibilità La parte del tempo in cui il servizio funziona, in percentuale Si calcola, e poi si misura sulla rete in esercizio Calcolarla per un apparato e non per il servizio che l’utente usa
SLA (livello di servizio) L’impegno contrattuale su disponibilità, tempi di intervento e di ripristino Il fornitore, nel contratto Non leggere dove si misura e cosa è escluso

I primi tre sono legati da una formula semplice: la disponibilità di un apparato è l’MTBF diviso la somma di MTBF e MTTR. Il quarto è un contratto, e va letto come tale.

La disponibilità in ore e minuti

Le percentuali con molti nove sembrano tutte uguali. Tradotte in tempo di fermo, sono mondi diversi.

Disponibilità Fermo massimo in un anno Fermo massimo in un mese di 30 giorni
99 per cento 87,6 ore, più di tre giorni e mezzo 7 ore e 12 minuti
99,5 per cento 43,8 ore 3 ore e 36 minuti
99,9 per cento 8,76 ore 43 minuti
99,99 per cento 52,6 minuti 4 minuti e 19 secondi
99,999 per cento 5,3 minuti 26 secondi

Due osservazioni pratiche. La prima: un solo guasto che richiede di ordinare un ricambio consuma in un colpo il margine di un anno al 99,9 per cento. La seconda: sopra il 99,99 per cento nessun intervento umano è abbastanza veloce, e la disponibilità si ottiene solo con apparati doppi e passaggi automatici. È il confine fra una rete “riparata bene” e una rete “ridondata”.

MTBF: cosa dice e cosa non dice

L’MTBF è una grandezza statistica calcolata su una popolazione di apparati, con metodi come Telcordia SR-332 (nato nel settore delle telecomunicazioni statunitensi), IEC 61709 (della IEC, International Electrotechnical Commission, la Commissione elettrotecnica internazionale) o MIL-HDBK-217F (il manuale del Dipartimento della Difesa degli Stati Uniti). Non è la durata di un singolo apparato. Con un tasso di guasto costante, uno switch con MTBF di 500.000 ore ha circa l’1,7 per cento di probabilità di guastarsi in un anno di funzionamento continuo. Su un parco di cento switch uguali, vuol dire aspettarsi in media poco meno di due guasti all’anno.

Tre cautele quando si confrontano schede tecniche. Metodi diversi danno numeri diversi per lo stesso apparato, quindi due MTBF si confrontano solo se sono calcolati con lo stesso metodo e alla stessa temperatura; l’associazione tedesca dell’industria elettrica (ZVEI, Zentralverband Elektrotechnik- und Elektronikindustrie) ricorda che un MTBF senza metodo e condizioni di calcolo non serve a niente. L’MTBF non comprende l’usura: ventole, alimentatori e batterie invecchiano con regole loro. E l’MTBF di un apparato non dice nulla sugli errori di configurazione, che nella pratica fermano le reti più spesso dei guasti.

MTTR: il numero che dipende da voi

Un esempio numerico mostra dove sta la leva. Uno switch con MTBF di 200.000 ore e un tempo di ripristino di 4 ore ha una disponibilità del 99,998 per cento. Lo stesso switch, se il ricambio va ordinato e arriva in tre giorni, scende al 99,964 per cento: quasi venti volte più fermo, con lo stesso apparato.

L’MTTR si accorcia con cose poco tecnologiche: un ricambio a scaffale per gli apparati critici, le configurazioni salvate in automatico, la documentazione della rete aggiornata, un accesso remoto sicuro per chi interviene, un contratto che copre gli orari in cui l’azienda lavora. Il tempo di intervento del fornitore è solo una parte dell’MTTR: il resto è diagnosi, sostituzione, ripristino della configurazione e verifica.

Dal singolo apparato al servizio: la catena

Un utente non usa uno switch: usa una catena di elementi, e basta che se ne rompa uno perché il servizio si fermi. Quando gli elementi sono in serie, le disponibilità si moltiplicano. Cinque elementi al 99,99 per cento ciascuno (per esempio switch di accesso, switch di distribuzione, core, firewall e linea) danno un servizio al 99,95 per cento: la catena è sempre meno disponibile del suo anello più debole.

Quando due elementi lavorano in parallelo e ciascuno basta da solo, si moltiplicano invece le indisponibilità. Due percorsi al 99,9 per cento danno in teoria il 99,9999 per cento. In pratica il conto regge a due condizioni: che i due percorsi non condividano un punto di guasto comune (la stessa alimentazione, la stessa canalina, lo stesso operatore) e che il passaggio dall’uno all’altro funzioni davvero quando serve. La prima condizione si verifica sul progetto, la seconda solo con un collaudo.

Come si progetta la ridondanza negli impianti è spiegato nella guida alle reti industriali ad alta affidabilità e, per gli uffici e le PMI, nella guida alla ridondanza di rete in azienda; per il firewall in coppia c’è la guida al FortiGate in alta disponibilità, per le due linee internet quella sull’SD-WAN per PMI (Software-Defined WAN, Wide Area Network: più linee internet gestite insieme da un solo apparato, nelle piccole e medie imprese).

SLA: cosa leggere nel contratto

Un SLA dice poco finché non si leggono le sue definizioni. Le domande da fare sono sei.

  1. Dove si misura la disponibilità: sull’apparato del fornitore, sul punto di consegna della linea o dal punto di vista dell’utente?
  2. Su quale periodo: mese o anno? Il 99,9 per cento su un anno permette un fermo di otto ore in un giorno solo.
  3. Cosa è escluso: manutenzioni programmate, cause di forza maggiore, guasti su apparati del cliente.
  4. Tempo di intervento o tempo di ripristino: il primo dice quando arriva qualcuno, il secondo quando il servizio torna.
  5. Quali orari: ore lavorative, dodici ore al giorno, sempre.
  6. Cosa succede se l’impegno non è rispettato, e chi produce il rapporto che lo dimostra.

Per chiarezza sul nostro: per i clienti con contratto in Emilia-Romagna Netframe interviene entro 4 ore lavorative. È un tempo di intervento. Il tempo di ripristino dipende dal guasto, dai ricambi disponibili e dalla ridondanza della rete, ed è proprio per questo che nei progetti lo calcoliamo a parte.

Come si misura sulla rete in esercizio

La disponibilità calcolata è una previsione; quella misurata è un fatto. Per misurarla servono tre strumenti che molte aziende hanno solo in parte.

  • Monitoraggio degli apparati. Il sistema di monitoraggio interroga switch, firewall e access point a intervalli regolari e registra quando non rispondono, quando si riavviano, quando una porta o un alimentatore cambia stato.
  • Sonde di servizio. Misure attive dal punto di vista di chi lavora: un apparato o un software in un reparto che raggiunge a intervalli fissi i servizi importanti (il gestionale, internet, il fleet manager che coordina i robot di magazzino) e registra ritardo, perdita e interruzioni. Misurano la disponibilità del servizio, non del singolo apparato.
  • Registro degli incidenti. Ogni fermo con inizio, fine, causa e intervento. È da qui che esce l’MTTR reale, e con il tempo anche l’MTBF reale della vostra rete.

La frequenza di misura conta quanto lo strumento. Con un’interrogazione ogni 5 minuti, un fermo di 3 minuti può non comparire mai nei grafici. Per gli apparati critici si usano intervalli di 30-60 secondi, le notifiche immediate (trap SNMP, Simple Network Management Protocol, e messaggi syslog verso un server centrale) e le sonde di servizio ogni 10-30 secondi; sugli apparati Cisco le sonde si configurano con la funzione IP SLA (misure attive eseguite dall’apparato stesso), sui FortiGate con i Performance SLA dell’SD-WAN (i controlli di prestazione), che misurano ritardo, variazione del ritardo e perdita verso destinazioni scelte.

Per la parte wireless, che ha grandezze sue come segnale, occupazione del canale e roaming, vale la guida al monitoraggio del wifi aziendale.

Il collaudo: le prove che dimostrano i numeri

Una rete dichiarata ad alta disponibilità va collaudata con prove che riproducono i guasti. Le prove di prestazione verificano che il servizio rispetti banda, ritardo, variazione del ritardo e perdita promessi: le metodologie di riferimento sono la raccomandazione ITU-T Y.1564 (ITU-T è il settore standard dell’Unione internazionale delle telecomunicazioni) per l’attivazione dei servizi Ethernet e l’RFC 2544 dell’IETF (Internet Engineering Task Force, l’organismo che pubblica gli standard di internet nei documenti RFC, Request for Comments) per le misure sugli apparati.

Le prove di failover verificano che la ridondanza funzioni. Si mette in rete un traffico continuo e misurabile, poi si stacca un cavo, si spegne un alimentatore, si spegne uno dei due firewall, si fa cadere la linea principale. Per ogni prova si registra quanto è durata l’interruzione vista dal traffico e se il ritorno alla situazione normale avviene senza un secondo fermo. Un failover mai provato non è ridondanza: è una speranza. Per le linee di produzione dove anche pochi millisecondi contano, esistono protocolli a interruzione zero, PRP (Parallel Redundancy Protocol) e HSR (High-availability Seamless Redundancy), descritti nella guida alle reti PRP e HSR.

Il documento di collaudo elenca le prove, i tempi misurati e le soglie concordate prima. È il documento che trasforma un numero del capitolato in una prestazione dimostrata.

Quanto dura un failover: i tempi dei meccanismi

Ogni meccanismo di ridondanza ha un suo tempo di rilevamento del guasto, deciso dai timer. Con i valori di default molti meccanismi impiegano secondi, non millisecondi: è il primo parametro da controllare in un progetto.

Meccanismo Timer di default Rilevamento con i default Come si accorcia
LACP (Link Aggregation Control Protocol, aggregazione di più link in uno) Pacchetti di controllo (LACPDU) ogni 30 s, modalità slow 90 s se il link resta su ma il vicino non risponde Rate fast: LACPDU ogni 1 s, rilevamento in 3 s
RSTP (Rapid Spanning Tree Protocol, IEEE 802.1w, oggi nella IEEE 802.1Q; IEEE, Institute of Electrical and Electronics Engineers) Hello 2 s Sotto il secondo se il link cade; 6 s se il link resta su Link punto-punto, porte edge sugli utenti
MRP (Media Redundancy Protocol, IEC 62439-2), anelli industriali Profilo 200 ms, fino a 50 nodi Ripristino massimo garantito dal profilo Profili a 30 o 10 ms dove supportati
PRP e HSR (IEC 62439-3) Nessuno: frame duplicati Zero interruzione Già al minimo
VRRP (Virtual Router Redundancy Protocol, RFC 5798) Advertisement 1 s Circa 3,6 s con priorità 100: tre intervalli più lo skew time Intervalli sotto il secondo, se gli apparati li supportano
HSRP (Hot Standby Router Protocol, Cisco) Hello 3 s, hold 10 s 10 s Timer in millisecondi o BFD (Bidirectional Forwarding Detection, rilevamento rapido dei guasti)
OSPF (Open Shortest Path First, protocollo di instradamento) Hello 10 s, dead 40 s 40 s se il link resta su BFD (RFC 5880): per esempio 3 × 50 ms, rilevamento in 150 ms

Il guasto silenzioso

Il caso che inganna è il guasto silenzioso: il link fisico resta acceso, ma dall’altra parte l’apparato non inoltra più traffico. È lì che contano i timer dei protocolli, ed è lì che i default portano a decine di secondi di fermo. Il tempo di commutazione dei firewall in coppia e delle due linee internet dipende dai timer di heartbeat e dai controlli di raggiungibilità configurati: va misurato, non letto sulla scheda.

Come si misura il tempo di interruzione

Il metodo più semplice è un flusso di pacchetti a cadenza fissa attraverso il percorso ridondato. Da un computer Linux, ping -i 0.01 verso un indirizzo dall’altra parte della rete invia 100 pacchetti al secondo (con le versioni di ping più vecchie servono i privilegi di amministratore per intervalli sotto 0,2 s): ogni pacchetto perso durante la prova vale 10 millisecondi di interruzione. Per le misure di perdita e variazione del ritardo sotto carico si usa iperf3 in UDP (User Datagram Protocol, il trasporto senza ritrasmissioni usato da voce e video), con banda e durata fissate (per esempio iperf3 -u -b 10M -t 60).

La prova si ripete per ogni guasto simulato e per il ritorno alla situazione normale, che a volte provoca una seconda interruzione quando l’apparato primario riprende il ruolo. Soglie di esempio da concordare prima: verde sotto i 200 ms per una rete d’ufficio con voce, giallo fino a 1 s, rosso oltre; per le celle di produzione la soglia la dà il timeout dichiarato dal costruttore della macchina.

Nelle reti industriali: la disponibilità della linea

In fabbrica la domanda giusta non è “quanto è disponibile la rete” ma “quanto è disponibile la rete per quella linea”. Una cella di produzione ha la sua catena: gli switch della macchina, lo switch di reparto, il collegamento al server di supervisione, a volte la radio per i veicoli. Il calcolo e la misura vanno fatti per ogni catena che, se si ferma, ferma la produzione.

Il secondo passo è pesare il fermo. Un’ora di rete ferma in ufficio e un’ora di linea ferma non costano uguale, e il livello di ridondanza si decide confrontando quanto costa il fermo con quanto costa evitarlo. L’architettura complessiva, con la separazione fra uffici e produzione, è descritta nella guida alla progettazione di reti industriali IT/OT (IT è l’informatica d’ufficio, OT la tecnologia operativa: macchine, controllori e supervisione).

Per la PMI: da dove partire

  1. Elencare i servizi che non possono fermarsi e, per ognuno, quanto fermo è accettabile in un anno.
  2. Disegnare la catena di ogni servizio e trovare gli elementi singoli, quelli senza un secondo pronto a subentrare.
  3. Stimare l’MTTR reale di quegli elementi: ricambi, contratto, orari, configurazioni salvate.
  4. Decidere dove conviene accorciare l’MTTR e dove serve ridondanza, partendo dai servizi più costosi da fermare.
  5. Collaudare il failover e misurare nel tempo con monitoraggio, sonde e registro degli incidenti.

Come lavora Netframe

Netframe progetta reti aziendali e industriali in tutta l’Emilia-Romagna partendo dai servizi che non possono fermarsi: calcola la disponibilità della catena, individua i punti singoli di guasto, propone dove serve ridondanza e dove basta accorciare i tempi di ripristino. Installa apparati Cisco, Huawei e Fortinet, di cui è partner certificato, collauda il failover con prove documentate e imposta il monitoraggio. La posa dei cavi è affidata a installatori qualificati coordinati da Netframe.

Il servizio di rete è descritto nella pagina Reti aziendali. L’assistenza per i clienti con contratto in Emilia-Romagna interviene entro 4 ore lavorative.

Domande frequenti sull’affidabilità di una rete

Come si misura l’affidabilità di una rete?

Con tre grandezze: l’MTBF, che dice ogni quanto in media si guasta un apparato; l’MTTR, che dice quanto si impiega a tornare in servizio; la disponibilità, che dice per quale parte del tempo il servizio funziona. La disponibilità si calcola in progetto e si misura in esercizio con il monitoraggio degli apparati, le sonde di servizio e il registro degli incidenti.

Cosa vuol dire una disponibilità del 99,9 per cento?

Che il servizio può restare fermo fino a 8,76 ore in un anno, circa 43 minuti al mese. Al 99,99 per cento il fermo scende a 52,6 minuti all’anno, al 99,999 per cento a poco più di 5 minuti. Sopra il 99,99 per cento servono apparati doppi e passaggi automatici, perché nessun intervento umano è abbastanza veloce.

Che differenza c’è fra MTBF e durata di un apparato?

L’MTBF è una media statistica calcolata su una popolazione di apparati, con un metodo come Telcordia SR-332 o IEC 61709. Non è la durata: uno switch con MTBF di 500.000 ore ha circa l’1,7 per cento di probabilità di guastarsi in un anno. L’MTBF non comprende l’usura di ventole, alimentatori e batterie, e due valori si confrontano solo se calcolati con lo stesso metodo.

Come si calcola la disponibilità di una rete con più apparati?

Per gli elementi in serie le disponibilità si moltiplicano: cinque elementi al 99,99 per cento danno il 99,95 per cento. Per gli elementi in parallelo, dove ciascuno basta da solo, si moltiplicano le indisponibilità: due percorsi al 99,9 per cento danno in teoria il 99,9999 per cento, a patto che non abbiano guasti in comune e che il failover sia stato collaudato.

Cosa controllare in un SLA di rete?

Dove si misura la disponibilità, su quale periodo, cosa è escluso, se l’impegno è sul tempo di intervento o sul tempo di ripristino, in quali orari vale e cosa succede se non viene rispettato. Un SLA al 99,9 per cento annuo permette otto ore di fermo in un giorno solo, e un tempo di intervento non garantisce quando il servizio torna.

Quanto dura un failover di rete?

Dipende dal meccanismo e dai timer. Con i valori di default, VRRP rileva il guasto in circa 3,6 secondi, HSRP in 10, OSPF in 40 se il link resta acceso, LACP in 90; con BFD o timer accorciati si scende a frazioni di secondo. Gli anelli MRP garantiscono 200 ms nel profilo di base, PRP e HSR nessuna interruzione. Il valore vero si misura al collaudo con un flusso di pacchetti a cadenza fissa.

Chi progetta e collauda reti ad alta disponibilità in Emilia-Romagna?

Netframe, system integrator IT con sede a Modena, progetta reti aziendali e industriali in tutta l’Emilia-Romagna partendo dai servizi che non possono fermarsi: calcolo della disponibilità, ridondanza dove serve, apparati Cisco, Huawei e Fortinet, collaudo documentato del failover e monitoraggio. Il servizio è descritto nella pagina Reti aziendali.

Fonti

Fonti verificate il 28 settembre 2026.

Nota di indipendenza

Netframe è un system integrator indipendente, non affiliata ai produttori citati salvo dove indicato: è partner certificato Cisco, Fortinet, Huawei, AudioCodes, Patton, 3CX e Ascom; Ekahau è uno strumento di lavoro, non una partnership. La posa dei cavi è affidata a installatori qualificati coordinati da Netframe. Gli esempi numerici di questa guida servono a spiegare il calcolo e non sono dati di prodotto. Netframe progetta e collauda reti aziendali e industriali dalla sede di Modena, in tutta l’Emilia-Romagna.

Other Articles