測量方法
涵蓋數字是這樣做出來的。
這個網站上每一個速度、等級、樣本數背後的完整方法,包括讓我們自己的數字看起來比較差的那些部分。
這篇由誰撰寫
Mara Ellison, 量測負責人
打造了方法頁上說明的被動量測流程,並在每一列覆蓋數據發布前逐一確認。
負責範圍
- 覆蓋量測方法
- 各國網速與樣本數
- 公開的覆蓋數據集
審閱者 Jonah Reyes
被動測量,不是測速
合成測速會開啟一條連線,把資料灌進去,然後記錄峰值。它測的是有人在看的那幾秒鐘裡,網路能發揮的最佳表現,而且過程會用掉你的流量。我們不做這種測試。
我們記錄的是已經發生的事。當你的手機載入地圖圖磚、開啟網頁或進行通話時,作業系統早就知道傳輸了多少位元組、花了多久時間。我們只取這些:位元組數、時長、手機所連的網路、使用的無線電類型,以及粗略的位置。不收封包內容,不收地址,不收頁面名稱。
這個結果值得直說。我們的數字會比測速結果低。在同一條街用同一個網路做測速,數字會更大,因為測的是不一樣的東西。我們公布的是你正常使用手機時實際拿到的傳輸速度,這才是決定視訊通話撐不撐得住的數字。
位置在儲存前先模糊化
連線位置會在手機上被四捨五入到邊長約 1 km 的網格,之後才會被寫入任何地方。精確座標在裝置上就被丟棄,從來不會離開裝置,所以沒有細緻的軌跡可以外洩、被傳喚,或被賣掉。
這就是為什麼我們公布國家和城市,從不公布街道。東京市中心一個 1 km 大小的網格裡有數萬人,這足以說明網路的狀況,但不足以說明你這個人的任何事。
彙整建立在這之上。一列資料至少需要 25 台不同裝置才會存在,所以一個旅客在小鎮待一週,不會變成關於那個小鎮的公開數字。
丟棄測量值的規則
這套方法大部分是在做刪除。四條規則決定什麼會留下來,每一條都是因為保留那些資料會讓公布的數字失真才存在。
這些規則每一條都會把我們的主要數字往下拉。這正是判斷一個過濾條件是否誠實的方法。只會把自己的數字往上推的過濾條件,不是過濾,是篩選。
- 移動量少於 2 MB 的連線會被丟棄。這麼小的傳輸在無線電還沒完全啟動前就結束了,測到的是啟動過程,不是網路本身。
- 手機連上網路後的前 60 秒會被丟棄。連接、驗證和第一次承載設定在設計上就是慢的,不能代表你平常的下午。
- 由少於 25 台不同裝置組成的一列資料不會公布。看的是裝置數,不是連線數,所以一個重度使用者不會變成一整個國家的數字。
- 手機分享熱點給筆電的連線會被保留,因為旅客真的會這麼做,並且會加上標記,讓我們可以檢查它是把某個市場的數字拉高還是拉低。
各項過濾條件,以及各自使用的門檻
| 規則 | 門檻 | 存在的原因 |
|---|---|---|
| 最小連線量 | 2 MB | 更小的傳輸會在無線電啟動完成前就結束 |
| 暖機期間 | 連上網路後 60 秒 | 連接與驗證在設計上就是慢的 |
| 最少不同裝置數 | 25 | 一個重度旅客絕不能變成一整個國家的數字 |
| 位置精確度 | 約 1 km | 粗到足以描述一個網路,但不足以描述一個人 |
| 公布時間窗口 | 90 天 | 長到足以穩定,短到仍然真實 |
每月重新計算。不再符合門檻的一列資料會被撤回,而不是被凍結。
為什麼第十百分位比中位數更重要
中位數是你一天的正中間。一半的連線比它快,一半比它慢。這是公平的摘要,但不是你會感受到的數字。
你會感受到的是那難熬的十分鐘。計程車上斷斷續續的通話、登機門讀不出來的登機證、路口卡住的地圖。這些都落在分佈的最低十分之一,中位數完全看不到它們。兩個國家可能有相同的中位數,感受卻完全不同,因為其中一個有又長又慢的尾巴,另一個沒有。
所以每一列都同時公布兩個數字。第十百分位是當你需要連線能用,而不是需要它快的時候該看的數字:十次連線裡有一次比這個數字慢。當這兩個數字相差很遠時,代表這個網路不穩定,而不是慢,這是不同的問題,通常也是更糟的問題。
這也是對我們最不利的數字,這正是相信我們會公布它的理由。
75,333
支撐公布數字的連線數
145
有測量數據的目的地數
25
公布一列資料前需要的不同裝置數
1 km
儲存前的位置網格大小
公布的一列資料包含什麼
一列資料是某個國家和電信商在 90 天內的組合。它同時包含兩個數字、兩個樣本數,以及無線電類型的比例,因為沒有樣本數的數字只是意見。
每一列公布的資料包含什麼
| 欄位 | 意義 |
|---|---|
| 中位數 Mbps | 有一半測量到的連線比這個數字快 |
| 第十百分位 Mbps | 十次連線裡有一次比這個數字慢 |
| 不同裝置數 | 這一列資料是根據多少支不同的手機建立的 |
| 連線數 | 通過過濾條件的測量傳輸有多少筆 |
| 電信商 | 我們在那個國家連上的上游網路 |
| 時間窗口 | 這一列資料涵蓋的期間,目前是 90 天 |
這套方法看不到什麼
被動測量繼承了我們客戶的樣貌。它看得到客戶去了哪裡、什麼時候去、在那裡做了什麼,對其他所有地方則是視而不見。以下的盲點是結構性的,再多的流量也無法消除它們。
- 我們客戶不去的地方。就算把兩個城市測得很透徹,也說明不了第三個城市的任何事。
- 我們沒有合作的網路。我們只測我們連上的電信商,所以同一個國家的另一家網路可能更好,我們也不會知道。
- 網路的上限。如果沒有人下載得夠猛去找到上限,我們的數字就只是網路能力的下限,不是極限。
- 室內和室外的差別。我們不知道你當時是不是在地下室,而地下室往往是數字偏低的主要原因。
- 我們還沒有客戶之前的時期。上個月才開通的目的地,時間窗口短、樣本薄,這兩點都會印在頁面上。
- 我們的客戶沒遇到的擁塞情況。如果開球那一刻體育場裡沒有我們的旅客,那個體育場就不在資料裡。
這套方法最弱的地方
有三個弱點會改變你解讀一列資料的方式,所以它們該寫在這裡,而不是註腳裡。
第一是市場太薄。我們 145 個目的地中有 5 只靠單一上游網路運作,那裡的數字描述的是一家電信商,而不是一個國家。第二是裝置組成。iOS 和 Android 回報時間的方式略有不同,我們用來修正這個差距的做法是估計,不是測量,所以嚴重偏向某一個平台的市場,誤差會比樣本數看起來的更大。第三是時段。我們公布 90 天的資料,不針對時段做調整,所以旅客大多在週末晚上抵達的國家,看起來會比旅客多在週二早上抵達的國家慢。
這些都不是靠更大的樣本就能解決的問題,是這套設計本身的極限,而一個附上自己極限的數字,比沒有附上的更有價值。
同意,以及如何退出
測量預設是開啟的,可以在 App 的隱私設定裡一鍵關閉。關閉之後,你的服務、價格和客服都不會有任何改變。
選擇退出的裝置不會再傳送任何東西,包括粗略位置,我們也會刪除它之前傳送過的資料。我們不會出售這些資料。彙整後的資料任何人都能免費使用,這和資料生意的做法完全相反,而且是刻意的:這份資料集對我們來說,作為公開論據的價值比作為私有資產更高。
如何引用這些數字,以及如何質疑它們
這個頁面就是引用的來源。如果你要引用涵蓋範圍頁面上的數字,請註明那個頁面和你閱讀的日期,因為每一列資料每個月都會重新計算,數字會變動。
完整資料集以 JSON 格式公開在 /api/coverage,不需要金鑰,也沒有速率限制。機器可讀的摘要在 /llms.txt。我們要求的署名只有一項:連回數字出處頁面的連結。這就是全部的授權條件。
如果你能證明某個數字錯了,請告訴我們。修正內容會連同日期和變更說明一起刊登在真相報告上,不管這個修正對我們是否有利。這是讓公布的數字有意義的唯一方法。