所有文章
    SLATrustOperations

    99.99% Gateway 可用性到底代表咩

    一個 gateway 可用性數字包含同排除咗咩、量度邊界點運作,同埋接受一份訊息 SLA 之前應該問嘅問題。

    Flowstates Team·客戶 messaging operation2025年12月18日 · 約 5 分鐘閱讀

    可用性數字係算術,唔係送達承諾

    以 30 日一個月計算,99.99% 可用性容許大約四分鐘二十秒嘅不可用時間。呢個數字講嘅就係咁多。佢冇講幾多訊息去到手機、去得幾快,亦冇講收件人有冇作出行動。

    呢個分別好緊要,因為訊息傳送橫跨咗一堆由唔同人擁有嘅系統。「保證送達」唔可能係一項合約承諾,因為冇一個供應商能夠控制目的地網絡、手機或者監管機構。

    量度邊界劃喺邊

    一個 gateway 可用性數字應該講清楚佢量度緊邊啲組件。通常係供應商自己營運嗰部分:

    • API 接收:request 被接受同排隊。
    • 路由:每個訊息被派送到一條路由。
    • 狀態處理:供應商狀態更新被接收同標準化。
    • Callback 送達:狀態 callback 被派送到你嘅端點。

    呢個邊界以外嘅一切,屬於其他人:

    • 供應商路由同營運商行為。 過濾、限速同網絡事故都發生喺 gateway 以外。偵測佢哋同轉移流量係營運工作,唔係可用性。
    • 目的地網絡狀態。 擠塞或者營運商事故會影響送達,即使 gateway 完全可用。
    • 手機同收件人。 關機、冇覆蓋、封鎖發送方、訊息被無視。
    • 監管同註冊變化。 發送方身分重新註冊或者範本重新審批,可以喺 gateway 冇任何故障嘅情況下令流量停止。

    如果一份 SLA 冇明確講清邊界,你就冇辦法量度佢。

    決定呢個數字有冇意思嘅問題

    1. 技術上邊啲組件計入量度範圍——只係 API,定係更闊?
    2. 咩算不可用:錯誤回應、超過某個門檻嘅延遲,定係完全接觸唔到?
    3. 可用性係全球計算,定係按地區同路由計算?一個全球數字可以吸收一場長時間嘅地區性中斷而唔算違約。
    4. 有咩例外情況,計劃內維護點樣公告同計算?
    5. 量度來源係咩,粒度有幾細,你可唔可以睇到底層遙測數據?
    6. 呢啲遙測數據為咗爭議處理會保留幾耐?
    7. 如果冇達標,補償係咩,佔百分之幾多,要點樣申索?
    8. 對於發生喺量度邊界以外嘅劣化——例如過濾規則改變或者路由問題——公開嘅回應承諾係咩?
    9. 事故之後你會收到咩證據,喺咩時間內?
    10. 對於你控制唔到嘅依賴,例如路由健康同供應商狀態,你有幾多能見度?

    問題 8 通常最能揭示真相。大部分真正嘅訊息問題都喺可用性邊界以外,所以呢啲問題嘅回應承諾,比第四個 9 更重要。

    無論供應商喺呢啲方面講咗咩——通知期、檢查間隔、保留期、賠償機制、事後報告時間表——只有喺你合約或者公開嘅服務說明入面出現,先當佢係承諾。Flowstates 嘅承諾係 99.99% gateway 可用性;其他一切都應該用合約確認,而唔係由一篇文章推斷出嚟。

    可用性同營運係兩件唔同嘅產品

    一個受管理 gateway 嘅價值,大部分喺可用性數字以外:

    • 針對每個項目自己嘅基線,持續監測路由同目的地。
    • 事故期間向供應商,再透過佢哋向營運商升級。
    • 過濾或效能改變時做路由調整。
    • 隨市場規則變化處理註冊同合規事宜。

    呢啲都無法壓縮成一個運行時間百分比。佢哋反映喺事故頻率、偵測時間同應用程式結果度。

    供應模式唔會改變邊界

    Flowstates 銷售同營運訊息路由,支援客戶保留自己嘅供應商合約(BYOV),亦支援混合安排。量度邊界喺每種情況下都一樣:受管理 gateway 量度嘅係佢自己營運嗰部分,路由同營運商行為喺邊界以外,無論邊個持有供應合約都係咁。

    簡短版本

    問清楚邊界、計算方式、例外情況、證據同範圍外嘅回應承諾。一個能夠答到呢啲問題嘅供應商,係認真諗過營運嘅。一個只識報大數字但唔講邊界嘅供應商,冇諗過。

    想一齊梳理你嘅 messaging stack?

    預約一次 30 分鐘 review。冇 sales deck,我哋會睇你現有 setup,指出 operation risk 喺邊度。