投稿前先自己掃一輪:論文圖片誠信自檢的實戰做法

投稿前先自己掃一輪:論文圖片誠信自檢的實戰做法

一個博士生在畢業前三個月被通知,兩年前發表的第一篇論文有圖片重複的疑慮。他找不到原始檔——那台電腦已經還給實驗室,硬碟被重灌過。這篇文章要講的不是鑑識工具怎麼買,是投稿前你自己該做完的那五件事,以及為什麼第一件跟軟體完全無關。

投稿前先自己掃一輪:論文圖片誠信自檢的實戰做法

一位在中部某國立大學讀生科的博士生,在畢業口試前三個月收到期刊的來信。他兩年前發表的第一篇論文,被讀者指出 Figure 2 與 Figure 4 有疑似重複的區域,期刊要求他提供原始檔案。

他找不到。當年那台電腦已經還給實驗室,中間被重灌過兩次;原始的顯微影像存在一個外接硬碟裡,硬碟現在在誰手上沒人記得。

他最後提供了自己筆電裡的一份備份,但那已經是裁切、調過對比之後的版本——換句話說,他無法證明自己沒做過什麼。這件事拖了七個月,論文最後加了一份更正說明。他畢業了,但那七個月他的研究幾乎停擺。

這篇要講的不是鑑識軟體怎麼買。是投稿前你自己該做完的五件事,而第一件跟軟體完全無關。

為什麼要自檢:問題往往不是造假

先講清楚一件事,因為這決定了你看待自檢的態度。

被圖像鑑識工具標記的稿件,多數不是造假。常見的真實原因有這幾種:同一組實驗的圖在不同段落被重複使用而沒說明;排版時從投影片複製圖片,而那張圖已經被壓縮過;共同作者提供的圖,你不知道他做過哪些處理;以及最單純的——貼錯檔案。

這些在你眼中是疏漏,在期刊眼中都需要解釋。而解釋的關鍵不是你多誠實,是你拿不拿得出原始檔

第一步:把原始檔管理建起來(不用花一毛錢)

這是整篇文章最重要的一步,也是最常被跳過的一步。

實際做法有三個規則。規則一,原始輸出檔一律不動。 儀器吐出來的檔案(顯微鏡的 .czi、電泳的掃描原檔、流式細胞儀的 .fcs)建立一個唯讀資料夾,任何處理都在複本上做。規則二,每張進論文的圖都要有一份「處理紀錄」。 不需要很正式,一個文字檔寫明:來源檔名、日期、樣本編號、做了哪些調整(裁切範圍、對比參數、是否拼接)。規則三,實驗室層級的保存,不是個人層級。 學生會畢業、筆電會壞,原始檔要存在實驗室共同管理的位置,而且要有備份。

我知道這聽起來很行政。但前面那位博士生的七個月,就是因為這三件事都沒做。

第二步:建立可辨識的版本命名

第二個不用花錢但極有效的習慣:讓檔名自己說話。

不要有 fig2.tiffig2_new.tiffig2_final.tiffig2_final2.tif 這種東西。建議的格式是「實驗編號_樣本_處理_日期」,例如 EXP047_WT-day7_crop-contrast_20260315.tif

這件事的價值在你被問到的時候。當期刊問「Figure 3B 是哪一次實驗的」,你能在三十秒內回答,而不是花一個週末翻硬碟。

第三步:自己先逐圖比對一遍

在動用任何工具之前,先用人眼做一輪。這一步比多數人想像的有效,因為你知道實驗的脈絡,機器不知道。

檢查清單有四項:

  • 同篇內是否有重複圖:把所有圖排在同一張大畫布上縮圖檢視,重複的很容易跳出來
  • 自己過去論文是否用過同一張圖:這是自我抄襲最常見的來源,尤其是控制組的圖
  • 拼接痕跡:電泳圖如果是從不同膠拼起來的,要有明確的分隔線並在圖說中揭露
  • 對比調整是否過度:把亮度對比拉到極端會讓背景訊號消失,這在某些期刊的政策裡屬於不當處理

這一步做完,你會發現大部分的問題已經被自己抓到了。

第四步:用工具掃一輪(如果拿得到)

工具能做的是人眼做不到的事:跨越幾億張已發表圖片做比對,以及偵測肉眼看不出的複製移動痕跡。

目前的主流有兩家。Proofig 官網揭露的比對庫為 1.55 億張 PubMed 圖片,偵測精確率 99.4%,西方墨點法真陽性 97.68%、顯微影像真陽性 95.41%;產品線還延伸到參考文獻、統計與方法的檢查。ImageTwin 官網稱比對庫超過 1.6 億張已發表圖片,特別之處是會嘗試標示 AI 生成圖片的模型歸屬,使用方包含 Springer Nature、Elsevier 與 Taylor & Francis。

兩家都不公開標準定價,主要按機構與稿件量報價。所以最現實的路徑是請研究處或圖書館評估機構授權——這件事的效益是全校性的,由個人負擔並不合理。如果機構沒有,那就把前三步做到位,這已經能攔下多數的疏漏。

第五步:判讀報告,不要照抄結論

拿到報告之後最容易犯的錯是兩個極端:看到紅色標記就恐慌,或者覺得反正自己沒造假就忽略。

正確的判讀方式是把每個標記當成一個問題,逐一回答:「這兩個區域為什麼相似?」答案可能是「同一批樣本的相鄰視野,合理」、「排版時貼錯,要換圖」、或「這是我從舊論文拿來的控制組圖,需要加註引用」。三種答案對應三種行動。

如果你的答案是「我不知道」,那就是要回去找原始檔的訊號——而這時候你會很感謝第一步做過的事。

幾個常被誤判的情境

相鄰視野的顯微影像很容易被標記,因為它們本來就相似。這種情況要在圖說中說明取像方式。

時間序列的同一區域同理,第 0 小時與第 24 小時拍同一個位置,背景結構當然一樣。

標準化的示意圖元素(細胞外形、儀器示意)如果來自同一套素材庫,跨論文重複是正常的,但最好揭露素材來源。

控制組重複使用是灰色地帶。同一批控制組資料用在兩篇論文,需要在後一篇明確引註,否則會被視為自我抄襲。國科會的規範明確把「自我抄襲:研究計畫或論文未適當引註自己已發表之著作」列為違反態樣之一,這點台灣研究者要特別注意。

TheAI學院 評語

我們寫這篇的時候一直在想:為什麼一件這麼基本的事——保存好自己的原始資料——在台灣的研究環境裡這麼常被忽略?

答案大概是它不加分。發表算 KPI、計畫算 KPI,檔案管理不算。所以它永遠排在最後,直到出事。

評語:投稿前自檢最關鍵的一步不在軟體,在你三年後還找不找得到原始檔——這件事不花錢,卻是唯一能真正保護你的東西。

給台灣讀者的具體建議,按投報率排序。第一,今天就建立唯讀的原始檔資料夾與實驗室層級的備份,這是零成本、最高回報的一步。第二,把版本命名規則訂下來並寫進實驗室的新人手冊,讓它變成習慣而不是某個人的自律。第三,投稿前排一次人眼逐圖比對,一小時的事。第四,向研究處爭取機構授權的鑑識工具,並且要求配套的判讀訓練——買了沒人會看,比沒買更危險。

想了解這場攻防的整體背景,可以讀我們的 研究誠信攻防現場;如果你的問題偏向「AI 輔助寫作算不算抄襲」,站上也有一篇 專門的討論。學術寫作與文獻工具的部分,PaperpalScite 是不同階段的需求,別搞混。

資料來源

以上依公開資訊與各工具官方網站整理;各期刊的圖像處理政策不盡相同,投稿前請以該刊規定原文為準。

常見問題

我沒有造假,為什麼還要自檢?

因為多數被標記的問題不是造假,是管理疏漏——同一張圖用在兩個地方、排版時貼錯檔案、投影片上的圖被拿回論文用但已經壓縮過。這些在期刊眼中一樣需要解釋,而如果你找不到原始檔,解釋就會變得很困難。自檢的目的是在別人問之前先自己發現。

自檢工具很貴嗎?個人研究者付得起嗎?

主流工具(Proofig、ImageTwin)都不公開標準定價,主要按機構規模與稿件量報價,個別研究者的方案要洽詢。所以比較現實的路徑是兩條:一是請學校研究處或圖書館評估機構授權,這是最有效率的做法;二是先把不花錢的那部分做好——原始檔管理、版本命名、自己肉眼逐圖比對,這三件事能攔下大部分的疏漏。

被工具標記之後該怎麼回應期刊?

三個原則。第一,提供原始檔案而不是解釋文字——期刊要看的是證據。第二,說明處理步驟,包含用什麼軟體、做了哪些調整(對比、裁切、拼接),這些如果是合理的科學處理就要講清楚。第三,如果真的是貼錯圖,直接承認並提供正確版本,不要硬拗;拗過去被發現第二次,性質就變了。

AI 生成的示意圖可以放在論文裡嗎?

示意圖(schematic)跟數據圖要分開看。用 AI 產生的概念示意圖,多數期刊允許但要求揭露;把 AI 生成的東西當成實驗數據圖(顯微影像、電泳圖),那是造假,沒有討論空間。中間的灰色地帶是「用 AI 修圖」——去背、補雜訊、增強對比,這些的界線各期刊規定不同,投稿前一定要看該刊的圖像政策原文。