你怎麼知道文件真的轉對了?
你上傳一份文件,AI 給了你一個很有把握的答案,而你永遠不會知道——它該讀的那張圖表,根本沒出現在資料裡。看起來乾淨的轉換,不等於什麼都沒少。這一頁講的是我們如何讓這個差別被看見,以及我們目前還做不到的地方。
沒有人看得見的那種失敗
轉出來的文字通常看起來很正常。問題正在這裡:少掉的東西不會留下空位。
- 一張圖表承載了整份文件的結論。周圍的段落轉得完美無缺,圖表沒有轉過去,而且沒有任何記號告訴你它不見了。
- 報告中間有一頁是掃描的。前後文字都轉好了,那一頁卻是空的,或者是一段沒有人標記過的辨識猜測。
- 試算表裡的數字是公式算出來的。如果檔案本身沒有存下計算結果,那些儲存格就只是空白。
- 一旦文字送進 AI,這些都救不回來了——模型是根據它收到的東西回答,不是根據你的文件實際寫了什麼。
每一次轉換,我們都會告訴你的事
以下這些會自動出現在你的結果頁上。它們是從你的檔案量出來的,不是估計的。
- 你的文件裡有、但 Markdown 裡沒有的圖片、圖表、SmartArt 與內嵌檔案。Word、PowerPoint、Excel 的數字是精確的——直接來自檔案自己的內部結構。
- PDF 也有同樣的揭露,但寫成「至少 N 張圖片」。像標誌、分隔線這類小圖形是刻意不計入的,所以實際數量可能更多——我們寧可少報,也不要多報。
- 掃描頁實際上是哪個辨識引擎讀的、信心度多少。如果主要引擎當時無法使用、改用了較弱的備援引擎,我們會講出來——它對中文明顯較差,你有權在相信那段文字之前就知道這件事。
- 掃描頁面中,若含數字的 OCR token 信心比周圍文字低至少 10 個百分點,我們會同時顯示兩個數字並請你回原始檔核對。這只是需要檢查的警示,不代表該數字一定正確或錯誤。
- 掃描文件超過頁數上限時,有哪些頁完全沒有被轉換。
- 試算表中,哪些公式的計算結果從未被存進檔案。那些儲存格我們留白,不會自己編一個數字出來。
- 大型表格何時因為我們自己的上限而被截斷。
- 試算表中顯示四捨五入數字的儲存格。Excel 可能顯示 1,234.57、實際存的是 1,234.56789;我們跟隨顯示值,並告訴你哪些儲存格屬於這種情況,方便你回頭查原始檔。
- 擷取出的來源文字中,有數字未原樣出現在最終 Markdown 時。我們只告訴你數量、不列出你的數值,並請你回原始檔核對。
- 我們直接拒絕的時候——讀不到文字、有密碼保護、頁數過多、活頁簿過於複雜——都會說明原因。你不會拿到一個被包裝成成功的空結果。
我們目前還做不到的事
這一段存在的理由是:一個只列自己強項的驗證工具,不算驗證工具。以下是真實的缺口,我們寧願你從我們口中聽到。
- 原始檔中的數字是否正確。我們現在會比較擷取出的來源文字與最終 Markdown 的數字 token,並標示未原樣出現的數字;但 OCR 或文字擷取器本身讀錯時,仍可能把同一個錯誤一路保留下來。數字對得上也不代表它仍在正確的標籤旁。數字 OCR 信心仍只是需要核對的訊號,不是真實數字的證明。
- 亂碼。我們現在會標出最終 Markdown 中明確出現的未知字元標記(�),但這只抓得到該標記;壞掉的 PDF 文字層也可能全是看似有效的字元,而我們仍無法可靠辨識。OCR 信心分數也只涵蓋影像辨識頁面,不涵蓋檔案原有文字。
- 轉出來的文字是否正確。我們回報的是「什麼帶過去了、什麼沒有」,不判斷語意有沒有走樣。
- 複雜排版的閱讀順序。我們盡力處理,但目前沒有量測自己做得多好。
拖入文件——或直接貼上截圖
PDF、Word、PowerPoint、Excel、HTML、CSV/TSV、TXT,或截圖(PNG/JPG——用 Ctrl/⌘+V 貼上)· 最大 100 MB
我們憑什麼敢這樣講
- Office 檔案本身是有固定內部結構的壓縮檔,所以圖片和圖表是從檔案自己的內容清單數出來的,不是猜的。
- PDF 裡沒有「圖片清單」這種東西,只有繪圖指令,所以我們跟著那些指令走,量出每張圖實際佔了頁面多大。小到不可能是內容的,一律當成裝飾,不列入計數。
- 上述每一項行為都有自動化測試把關,每次改動前都會跑——其中包含專門用來防止這些數字被灌水的測試。
- 當一項量測無法完成時,我們選擇什麼都不說,而不是回報一個零。「我們沒有看」和「本來就沒有」是兩件不同的事。
這一頁會改
上面那份缺口清單是目前誠實的狀態,不是永久的限制。隨著偵測能力變好,項目會從第二份清單移到第一份。如果你遇到我們沒能提醒你的狀況,告訴我們是讓它最快發生的方式。
常見問題
這是不是代表我的圖表和圖片都不見了?
圖片本身確實不會被帶進 Markdown,因為 Markdown 是文字。我們做的是確保你知道它存在過,這樣你可以用別的方式把那份資訊補給 AI,而不是誤以為它已經看到了。
為什麼 PDF 不能也直接給精確數字?
因為我們拿不到一個誠實的精確數字。PDF 描述的是繪圖動作,不是一份圖片清單;若照實數,一個重複出現的頁首標誌就會變成幾十張「不見的圖片」。我們排除小圖形,代表我們的數字可能低於實際,但絕不會是編出來的。
你們會檢查轉出來的文字正不正確嗎?
不會,我們也不會假裝會。我們回報的是什麼帶過去了、什麼沒有。判斷語意有沒有走樣是另一個問題,假裝我們已經解決了它,就違背了這一頁存在的意義。
更多這樣的教學
我們正在寫一系列關於「怎麼把文件正確餵給 AI 工具」的教學。留個信箱,新的出來我們就寄給你。不保證頻率、沒有行銷信序列,回一句話就可以取消。
檔案保留政策
上傳的原始檔與轉換結果都屬暫時資料,不會被保存為永久文件庫。
- 上傳的原始檔只用於產生您的 Markdown 結果,處理結束後立即刪除,最晚不超過 60 分鐘。
- 轉換結果與任務紀錄最多提供 60 分鐘,期限屆滿後即失效,並由系統自動從使用中的資料庫移除。
- 我們不建立永久文件庫;但由服務商管理的基礎設施快照可能保留殘餘副本,最長 5 天後自動失效。
- 上傳的原始檔只在任務處理期間存放於暫時性本機空間;若處理中斷,定期清理程序會移除任何已逾期的暫存檔。