首頁 · 免費工具 · 模糊比對

把兩份清單模糊比對起來

左邊貼一份清單,右邊貼另一份。第一份裡的每個值都會配到第二份中最接近的對象, 每一組還帶著它拿到的分數 —— 所以 ACME企業 找得到 ACME企業, 而且你在採用之前就看得到那一組有多可靠。不用安裝增益集,也不會上傳任何東西。

清單 A 你要查的值

清單 B 要去裡面查的清單

不會上傳任何東西。檔案由這個分頁的 JavaScript 讀取,不會離開你的電腦 —— 沒有任何伺服器看得到,關掉分頁資料就沒了。

什麼是模糊比對

精確比對問的是「這個值在另一份清單裡嗎」。模糊比對問的是你真正想知道的事 —— 「對面那一筆,是不是換了個寫法的這一筆」,而且用 0 到 100% 的分數回答,不是用是或否。

如果兩份清單的值本來就一模一樣,你只要交集,那 精確的清單比較 更快,也沒有門檻可以設錯。

中文名稱的寫法差異 —— 附實測分數

以下是用這一頁的預設值量出來的:

  • ACME企業ACME企業 —— 100%。 全形英數會先被正規化(Unicode NFKC),所以根本不會變成差異。
  • 台灣積體電路台灣積體電路製造 —— 90%。 公司簡稱與全名這一類,靠的是「短的那個嵌在長的裡面」這條路。
  • 王小明王 小明 —— 姓名之間多一個空白,正規化不會消掉它; 中文姓名很短,一個字元的比重就很大。名冊要對起來時,門檻往 75% 附近調比較實際。

這些數字寫在這裡,是因為每一列都會顯示分數,而且拖動滑桿會即時重算。 門檻不是靠猜的,是在你自己的資料上決定的。

「接近」有三種

  • 打錯字。 編輯距離,而且相鄰兩個字互換只算一次錯誤 —— 那是最常見的打字錯誤形式。
  • 順序不同。 在排序去重後的詞集合上再算一次,所以只是前後對調的會拿到 100%。
  • 被簡稱。 看短的那個嵌進長的裡面有多貼合,再依長度比例打折。

數字是識別碼,不是寫法

發票 1001發票 1002 以文字來看像 92%,而它們是兩張不同的發票。 一個會安靜地把它們配在一起的比對,比不比對還糟,因為錯誤在結果裡看不出來。 所以當兩邊的值都含數字、而且數字不同時,不管文字多像,這一組都會被壓在門檻以下。 單號、料號、客戶編號、郵遞區號在預設值下都是安全的。

不會離開這個分頁

會拿來模糊比對的是客戶名冊、供應商名冊和員工名冊。兩份清單都由這個分頁裡的 JavaScript 評分。根本沒有送出的請求,也就沒有可以被攔截、記錄或保留的東西。

常見問題

Excel 要怎麼做模糊比對?

在 Excel 裡面,不是用 Fuzzy Lookup 增益集(要另外下載,只有 Windows 版), 就是在 Power Query 的合併步驟裡開啟模糊比對。這一頁是兩者都不需要的版本, 而且會顯示每一列拿到幾分,不是只給你通過的那些組。

門檻要設多少?

公司名和人名,80% 是合理的起點。姓名之間空白不一致的名冊,往 75% 調。 每一列旁邊的分數會告訴你該往哪個方向走。

「股份有限公司」和「股份公司」會被視為相同嗎?

在預設門檻下不會。比的是字元不是語意,背後沒有一份公司組織型態的對照表。 把門檻調低,再檢查多出來的那幾組。

為什麼「發票 1001」配不到「發票 1002」?

這是刻意的。當兩邊的值都含數字而且數字不同時,不管文字多像,都當成不同的紀錄。 如果你的資料不是把數字當識別碼用,把「數字必須完全相同」取消勾選即可。

可以處理多少列?

每邊數千筆會在遠低於一秒內算完:候選是先用字元 2-gram 索引篩過, 而不是每個值都跟所有值比一遍。筆數和耗時會顯示在結果下方。

同一件事,在自己的電腦上做

TableDI 是一套完全在自己電腦上執行的桌面試算表工作空間。 匯入、整理、做成圖表 —— 什麼都不會上傳,也不用註冊帳號。

永久免費,不是試用 —— 不用帳號、不用信用卡。目前是 macOS,Windows 版準備中。付費版多了什麼

2026-09-01 由 TableDI 團隊最後檢查。這一頁有錯嗎?告訴我們 —— 只有一個收件匣,由做 TableDI 的人自己看。