一次公開的文件轉換品質對照測試
這一頁把首頁已公布的完整對照——結果、方法、限制,以及測試前訂定的門檻——保存在一個可分享的位置。
發佈日:2026-07-21。2026-07-21 執行的重跑逐位元重現每一個數字。
我們唯一做過的對照——以及我們沒達到的那條線
開始測之前,我們先把及格線定死:唯有在至少 70% 的文件上明確勝出,才可以宣稱自己比較好。結果我們是 33%。所以我們從來沒有做過那個宣稱,這一頁現在也沒有。
| 文件 | 格式 | LessTokens | MarkItDown | 結果 |
|---|---|---|---|---|
| 損益表 | XLSX | 5/5 | 5/5 | 平手 |
| 持股明細表 | XLSX | 5/5 | 5/5 | 平手 |
| 試算表邊界案例 | XLSX | 5/5 | 4/5 | 我們勝 |
| 服務合約 | DOCX | 5/5 | 5/5 | 平手 |
| 季報簡報 | PPTX | 5/5 | 5/5 | 平手 |
| 營運報告 | 5/5 | 3/5 | 我們勝 | |
| 雙欄報告 | 5/5 | 3/5 | 我們勝 | |
| 財務 CSV | CSV | 5/5 | 5/5 | 平手 |
| HTML 報告 | HTML | 5/5 | 5/5 | 平手 |
45/45 對 40/45——三勝、六平、零敗。
MarkItDown 在這場測試表現不錯
它拿到 45 分中的 40 分,而且九份文件裡有六份處理得完美無缺——跟我們一樣。它是一個能力不錯的免費工具,我們不會假裝不是。差距出現在三個地方,不是全面性的。
為什麼那條線不可能達到
九份文件裡有六份,兩邊都拿滿分。兩邊都能完美處理的文件,不管誰比較強都只會是平手——所以在這場測試裡,任何產品的最高分就是 33%,包括一個毫無瑕疵的產品。是這條線設計得不好。我們選擇講出來,而不是安靜地把它改掉。
我們願意講的話
這九份文件我們每一份都拿滿分,而且沒有任何一份分數低於對方。真正分出高下的那三份——試算表邊界案例,以及兩份 PDF(其中一份是雙欄排版)——都是我們勝出。
我們不會講的話
我們是市面上最好的工具。這場測試裡只有另外一個對手。而且我們還沒有做很多人最在意的那個對照——把原始檔案直接丟給 AI——所以我們無法告訴你,跟那個做法比起來如何。
所有限制這個結果的條件
- LessTokens 16.343.0 對 MarkItDown 0.1.6——LessTokens 是同一套已測量 pipeline 在目前版本規則下的名稱,MarkItDown 則是當時的最新版本——於 2026-07-21 用重新產生的語料重跑,每一個數字都完全重現。兩邊版本都標示出來,你可以自己重現。
- 九份文件。這是小樣本,我們就把它講成小樣本。
- 這些文件是合成的,由標準的開源函式庫產生,而不是我們自己的測試工具——所以題目不是用剛好適合我們的方言寫的。但它們仍然不是真實世界的檔案。
- 只有一個競爭對手。
- 我們每一份都滿分,這代表這場測試從來沒有測到我們的極限。我們知道自己贏了,但不知道贏多少。
這場測試是怎麼建立的
- 九份文件由標準的開源函式庫產生——openpyxl、python-docx、python-pptx、reportlab 與 pypdf——而不是我們自己的測試工具。這個區別很重要:用我們自己的產生器寫出來的題目,量到的會是「對方多會講我們的方言」,而不是它有多好。
- 每份文件從五個面向評分:閱讀順序、標題、表格、數字,以及有沒有東西不見了。任何啟發式規則可能合理有不同看法的地方,一律交給人判斷,不會默默算通過。
- 兩邊的輸出都經過同一個正規化程序,而那個程序沒有任何參數可以知道文字是哪個工具產生的。它無法偏袒任何一方。
- 如果某個工具根本打不開檔案,那會記錄成相容性問題,並且排除在品質分數之外——把對手的當機算成自己的品質勝利,就是懸殊結果的製造方式。這次沒有發生:兩邊對九份文件都成功產出。
覺得這個測試有問題?
告訴我們你認為該怎麼改,我們會重跑並公布新的數字——包括對我們比較不利的結果。來信 support@lesstokens.ai。
MarkItDown 是微軟以 MIT 授權釋出的開源專案。LessTokens 為獨立工具,與 Microsoft 並無關聯,亦未獲其背書或贊助。上述對照於本機對已發布的套件執行,未呼叫任何服務。