可用性數字係算術,唔係送達承諾
以 30 日一個月計算,99.99% 可用性容許大約四分鐘二十秒嘅不可用時間。呢個數字講嘅就係咁多。佢冇講幾多訊息去到手機、去得幾快,亦冇講收件人有冇作出行動。
呢個分別好緊要,因為訊息傳送橫跨咗一堆由唔同人擁有嘅系統。「保證送達」唔可能係一項合約承諾,因為冇一個供應商能夠控制目的地網絡、手機或者監管機構。
量度邊界劃喺邊
一個 gateway 可用性數字應該講清楚佢量度緊邊啲組件。通常係供應商自己營運嗰部分:
- API 接收:request 被接受同排隊。
- 路由:每個訊息被派送到一條路由。
- 狀態處理:供應商狀態更新被接收同標準化。
- Callback 送達:狀態 callback 被派送到你嘅端點。
呢個邊界以外嘅一切,屬於其他人:
- 供應商路由同營運商行為。 過濾、限速同網絡事故都發生喺 gateway 以外。偵測佢哋同轉移流量係營運工作,唔係可用性。
- 目的地網絡狀態。 擠塞或者營運商事故會影響送達,即使 gateway 完全可用。
- 手機同收件人。 關機、冇覆蓋、封鎖發送方、訊息被無視。
- 監管同註冊變化。 發送方身分重新註冊或者範本重新審批,可以喺 gateway 冇任何故障嘅情況下令流量停止。
如果一份 SLA 冇明確講清邊界,你就冇辦法量度佢。
決定呢個 數字有冇意思嘅問題
- 技術上邊啲組件計入量度範圍——只係 API,定係更闊?
- 咩算不可用:錯誤回應、超過某個門檻嘅延遲,定係完全接觸唔到?
- 可用性係全球計算,定係按地區同路由計算?一個全球數字可以吸收一場長時間嘅地區性中斷而唔算違約。
- 有咩例外情況,計劃內維護點樣公告同計算?
- 量度來源係咩,粒度有幾細,你可唔可以睇到底層遙測數據?
- 呢啲遙測數據為咗爭議處理會保留幾耐?
- 如果冇達標,補償係咩,佔百分之幾多,要點樣申索?
- 對於發生喺量度邊界以外嘅劣化——例如過濾規則改變或者路由問題——公開嘅回應承諾係咩?
- 事故之後你會收到咩證據,喺咩時間內?
- 對於你控制唔到嘅依賴,例如路由健康同供應商狀態,你有幾多能見度?
問題 8 通常最能揭示真相。大部分真正嘅訊息問題都喺可用性邊界以外,所以呢啲問題嘅回應承諾,比第四個 9 更重要。
無論供應商喺呢啲方面講咗咩——通知期、檢查間隔、保留期、賠償機制、事後報告時間表——只有喺你合約或者公開嘅服務說明入面出現,先當佢係承諾。Flowstates 嘅承諾係 99.99% gateway 可用性;其他一切都應該用合約確認,而唔係由一篇文章推斷出嚟。
可用性同 營運係兩件唔同嘅產品
一個受管理 gateway 嘅價值,大部分喺可用性數字以外:
- 針對每個項目自己嘅基線,持續監測路由同目的地。
- 事故期間向供應商,再透過佢哋向營運商升級。
- 過濾或效能改變時做路由調整。
- 隨市場規則變化處理註冊同合規事宜。
呢啲都無法壓縮成一個運行時間百分比。佢哋反映喺事故頻率、偵測時間同應用程式結果度。
供應模式唔會改變邊界
Flowstates 銷售同營運訊息路由,支援客戶保留自己嘅供應商合約(BYOV),亦支援混合安排。量度邊界喺每種情況下都一樣:受管理 gateway 量度嘅係佢自己營運嗰部分,路由同營運商行為喺邊界以外,無論邊個持有供應合約都係咁。
簡短版本
問清楚邊界、計算方式、例外情況、證據同範圍外嘅回應承諾。一個能夠答到呢啲問題嘅供應商,係認真諗過營運嘅。一個只識報大數字但唔講邊界嘅供應商,冇諗過。