清單 A 你要查的值
清單 B 要去裡面查的清單
不會上傳任何東西。檔案由這個分頁的 JavaScript 讀取,不會離開你的電腦 —— 沒有任何伺服器看得到,關掉分頁資料就沒了。
什麼是模糊比對
精確比對問的是「這個值在另一份清單裡嗎」。模糊比對問的是你真正想知道的事 —— 「對面那一筆,是不是換了個寫法的這一筆」,而且用 0 到 100% 的分數回答,不是用是或否。
如果兩份清單的值本來就一模一樣,你只要交集,那 精確的清單比較 更快,也沒有門檻可以設錯。
中文名稱的寫法差異 —— 附實測分數
以下是用這一頁的預設值量出來的:
ACME企業與ACME企業—— 100%。 全形英數會先被正規化(Unicode NFKC),所以根本不會變成差異。台灣積體電路與台灣積體電路製造—— 90%。 公司簡稱與全名這一類,靠的是「短的那個嵌在長的裡面」這條路。王小明與王 小明—— 姓名之間多一個空白,正規化不會消掉它; 中文姓名很短,一個字元的比重就很大。名冊要對起來時,門檻往 75% 附近調比較實際。
這些數字寫在這裡,是因為每一列都會顯示分數,而且拖動滑桿會即時重算。 門檻不是靠猜的,是在你自己的資料上決定的。
「接近」有三種
- 打錯字。 編輯距離,而且相鄰兩個字互換只算一次錯誤 —— 那是最常見的打字錯誤形式。
- 順序不同。 在排序去重後的詞集合上再算一次,所以只是前後對調的會拿到 100%。
- 被簡稱。 看短的那個嵌進長的裡面有多貼合,再依長度比例打折。
數字是識別碼,不是寫法
發票 1001 與 發票 1002 以文字來看像 92%,而它們是兩張不同的發票。
一個會安靜地把它們配在一起的比對,比不比對還糟,因為錯誤在結果裡看不出來。
所以當兩邊的值都含數字、而且數字不同時,不管文字多像,這一組都會被壓在門檻以下。
單號、料號、客戶編號、郵遞區號在預設值下都是安全的。
不會離開這個分頁
會拿來模糊比對的是客戶名冊、供應商名冊和員工名冊。兩份清單都由這個分頁裡的 JavaScript 評分。根本沒有送出的請求,也就沒有可以被攔截、記錄或保留的東西。
常見問題
Excel 要怎麼做模糊比對?
在 Excel 裡面,不是用 Fuzzy Lookup 增益集(要另外下載,只有 Windows 版), 就是在 Power Query 的合併步驟裡開啟模糊比對。這一頁是兩者都不需要的版本, 而且會顯示每一列拿到幾分,不是只給你通過的那些組。
門檻要設多少?
公司名和人名,80% 是合理的起點。姓名之間空白不一致的名冊,往 75% 調。 每一列旁邊的分數會告訴你該往哪個方向走。
「股份有限公司」和「股份公司」會被視為相同嗎?
在預設門檻下不會。比的是字元不是語意,背後沒有一份公司組織型態的對照表。 把門檻調低,再檢查多出來的那幾組。
為什麼「發票 1001」配不到「發票 1002」?
這是刻意的。當兩邊的值都含數字而且數字不同時,不管文字多像,都當成不同的紀錄。 如果你的資料不是把數字當識別碼用,把「數字必須完全相同」取消勾選即可。
可以處理多少列?
每邊數千筆會在遠低於一秒內算完:候選是先用字元 2-gram 索引篩過, 而不是每個值都跟所有值比一遍。筆數和耗時會顯示在結果下方。
相關頁面
同一件事,在自己的電腦上做
TableDI 是一套完全在自己電腦上執行的桌面試算表工作空間。 匯入、整理、做成圖表 —— 什麼都不會上傳,也不用註冊帳號。
永久免費,不是試用 —— 不用帳號、不用信用卡。目前是 macOS,Windows 版準備中。付費版多了什麼。
2026-09-01 由 TableDI 團隊最後檢查。這一頁有錯嗎?告訴我們 —— 只有一個收件匣,由做 TableDI 的人自己看。