工程師思路系列・事出必有因

八年的電腦,與工程師的停損點

版本二|完整脈絡版(含系統紀錄附註)

起點:八年似乎是電腦的壽命上限

這兩天處理了兩台出廠、售出八年多的電腦:ASUS ESC500 G4 工作站,與 ASRock DeskMini 110 迷你電腦。

ESC500 G4 全板固態電容,卻徹底不開機,無過電反應。DeskMini 110 開機無畫面,修整後換了好幾種 USB Live Linux,結果都一樣:不定期當機,而 CPU 與主機板溫度感應器的數值看起來都正常。

為什麼溫度正常,機器還是會死

這兩台我當年都做過熱處理:ESC500 G4 售出時為 PCH 加裝直吹的 8 公分風扇;DeskMini 110 拆下散熱器重塗散熱膏,把溫度壓在 40~60°C。熱的變因幾乎被排除,機器仍然走到終點。八年的瓶頸不全在溫度,而在材料與時間本身:

✔

焊點疲勞: 無鉛焊料經過數千次冷熱循環,產生微裂紋,症狀就是時好時壞。
✔

供電老化: VRM 的 MOSFET、電感與電容老化,只會在電流瞬變時發作,與溫度感應器無關。
✔

韌體資料衰退: SPI Flash 的資料保存有期限,只與時間有關,與溫度無關。
✔

電源與變壓器老化: 迷你機的外接變壓器是唯一電源,老化後在負載瞬變時電壓下陷,板上溫度當然正常。

一般經驗是:消費級與入門商用機約 6~8 年進入故障率上升期,工作站與伺服器級在環境良好時可以更久。這兩台剛好落在這個區間。

找同期主機板,沒有意義

換上去的是另一塊同樣老化八年的板子,焊點、電容、SPI Flash 的風險條件幾乎相同;再加上找料、運送、驗證與停機成本,總價逼近新機,而且修好後沒有保固。當年 NT$25,000~30,000 買的機器已服務八年,每年約三千多元,投資早已充分回收,現在不開機是材料老化的自然結果。

真正的代價是我的時間

我的企業服務費率是 NT$2,500/hr,一整天驗證約兩萬元;但電腦客戶心中的價位是「零件加工資」,這次基本檢測我只收 NT$300。資安閘道器的售前與建置,客戶買的是風險降低與責任承擔,費率與價值才對得上。年輕時通宵還能撐,現在不行。

最危險的時刻,是「好像救回來了」

傍晚電話沒打通客戶,我順著手感繼續測,一度以為救回來了,後來硬體不穩定才浮現,前功盡棄,也失去報價進階服務的機會。三個失誤:沒設停損、沒有客戶授權就延伸、把「看起來好了」當成「修好了」。

現場案例:看起來好了,隔天又發作(DeskMini 110)

這個案例把前面所有論點串在一起:我已經做了散熱、清潔、換 CPU、更新 BIOS,機器恢復流暢,準備通知客戶的那個早上,它卻只能停在自檢畫面、進不了 Windows,之後又自行恢復。

確認的事實

項目 紀錄
機型與環境 ASRock DeskMini 110(H110 STX),Pentium G4600(內顯 HD Graphics 630),使用約八年半;Windows 10 22H2 與 Linux Live USB
已做的處置 BIOS 由 7.2 更新至 7.9;清潔記憶體金手指;調整 C-State;更換同型號備品 CPU 交叉測試;散熱膏重塗
溫度 CPU 約 41~57°C,排除過熱
電壓(靜態) 變壓器輸出 19.16V;BIOS 內 12V/5V/3.3V 讀值正常
較易觸發的操作 播放 YouTube 即當機(Windows 與 Linux 皆然);在工作管理員切換到 GPU 頁籤,也會瞬間死當
最新事件 隔日早上只能到自檢畫面、進不了 Windows,之後自行恢復正常

能證明的,與不能證明的

1

能證明: 機器會在不同負載、不同時間點無預警當機(包含輕負載),同一個測試有時跑得完、有時跑不完;播放影片與切換 GPU 頁籤是較容易觸發的操作,且跨作業系統重現;另有一次無法進入系統。
2

不能證明: 內顯硬體已達「物理極限」。同樣的現象也可能來自供電瞬態不穩(內顯一上負載,電流瞬變變大)或記憶體路徑問題(內顯使用系統記憶體)。
3

電壓「正常」的證據力有限: 變壓器與 BIOS 的讀值都是靜態、低取樣的數字,抓不到負載瞬間的短暫下陷。正確寫法是「靜態讀值正常,無法排除瞬態不穩」,不是「已排除」。
4

BIOS 更新不等於修好: 更新後恢復流暢,只是換了一個變因;而且在供電可能不穩的機器上刷 BIOS,寫入中途斷電有變磚風險,這次沒事是運氣,下次不建議再做。

穩定性觀察:平放後的多輪測試(2026/10/2)

機器改為平放後,在同一天連續做了三輪開機測試,目的是替「看起來好了嗎」找證據,不是找故障零件。

輪次 測試內容 結果與數據
第一輪 CPU 滿載算圖(SilverBench,約 4 分鐘) 全程 3.6 GHz,核心最高約 64~65°C,與 TjMAX 差距約 36°C;各項降頻與功耗限制旗標皆為「否」;Vcore 約 1.07 V,VR 電流峰值約 17.3 A;算圖完成、出現結果後,機器當機。滿載後核心溫度回到約 46~50°C
第二輪 Speedometer 2.0、MotionMark 1.3.2 兩項都跑完(MotionMark 約 716 分、60 fps);此時 GPU 0 使用率約 52%,確認內顯有在工作;連續運作約 17 分鐘後當機
第三輪 Speedometer 2.0(173 ± 28)、另一網頁基準測試(Beta 版、未校準)、MotionMark 1.2 前兩項跑完;MotionMark 1.2 在輕負載(CPU 約 7%、GPU 約 2%)的文字排版項目途中當機
✔

熱已排除: 滿載與降溫兩端都有數據,溫度正常、無降頻。
✔

CPU 與記憶體路徑: 滿載算圖與瀏覽器測試多次跑完,沒有出現運算錯誤。
✔

2D 繪圖與內顯: 在約 50% GPU 負載下可以跑完;但同一個 MotionMark,一輪跑完、另一輪跑不完。
✔

當機時間點分散: 算圖完成後、測試跑完後、輕負載途中,找不到共同觸發點。
樣本與邊界: 姿勢(直立或平放)是否有影響,樣本數只有一,無法下結論。電壓與溫度皆為單次讀值。當機當下是凍結還是自動重開、事件檢視器有無 Kernel-Power 41,這次未記錄(查法見附註七),因此成因仍然未定,供電與記憶體路徑都無法排除。Beta 版基準測試的品質警告,不當作硬體證據。

給客戶看的結果表(日常情境版)

客戶不關心分數,只關心「平常的事能不能做」。把測試翻成日常語言,不展示任何分數:

客戶的日常 結果
打文件、開試算表 跑完
上網、翻頁 跑完
網頁動畫 一次跑完,一次中途當機
看影片 容易當機
做完事、放著不動 自己當過機

這張表的說服力在於:同一件事,一次能做、一次不能做。 客戶不需要懂供電或韌體,就能理解「不可靠」是什麼意思。說法上用「目前觀察到可以做」,不說「文書沒問題」,也不主動拿出分數,免得客戶誤以為「分數不錯,應該還行」。

處置與對客戶的說法

✔

關閉瀏覽器的硬體加速,作為暫時的繞過方式,讓影音解碼改由 CPU 承擔。
✔

先完整備份資料,不再做新的診斷或系統更新。
✔

建議換機;換機前避免在這台機器上做重要作業。
「這台主機有兩個確認的現象:一是播放影音容易當機,連輕量的網頁動畫測試也有一次跑到一半自己當機;二是後來又發生一次無法進入系統的狀況,之後自行恢復。我們已關閉硬體加速作為暫時繞過,目前可以使用,但不保證穩定,也無法排除供電或硬體老化的潛在問題。建議先完整備份資料並規劃換機。」
作業系統也是理由: Windows 10 已於 2025 年 10 月結束一般支援(延伸安全更新另有期限),而 G4600 為第 7 代處理器,官方不支援升級 Windows 11。這台機器即使修好,系統層面也已走到尾聲。請以微軟官方頁面確認最新狀態後再對客戶引用。

這個案例的教訓

1

「看起來好了」連隔天都撐不到。 結案條件是壓力測試加上觀察期,不是當下能開機。
2

報告要寫「成因未定」,不要把推測寫成定論。 一旦被問「你怎麼確定不是供電」,定論式的報告就站不住腳。
3

時間點分散,本身就是證據。 三次當機分別落在算圖完成後、測試跑完後、輕負載測試途中,找不到共同觸發點,這比「有規律的觸發條件」更像老化型的間歇故障。要不要追根究柢,以費率衡量,通常不值得。
4

測試越多,越不能當結案依據。 每一次通過,只代表「這一次」;結論靠的是多次、不同情境下的不穩定,不是任何一次的成功。

根源在接案那一刻

兩位客戶送修前一定都有前兆:不定期當機、BSOD、偶爾不開機。我沒追問,因為工程師本能一被啟動就直奔機器。如果當時問出這些症狀,我就不會堅持搶救。真正該設停損的地方,在接案問診,而不在檢測桌上。

接案問診(任一題答「是」即停手)

1

機齡是否超過八年?
2

最近有沒有不定期當機、藍畫面、要開好幾次才開得起來?
3

當機的時候,有沒有剛好在更新、安裝或存檔?
4

有沒有備份?有沒有系統還原點?
5

如果要重灌,手上有沒有原廠驅動與常用程式的安裝檔?

當機之後,軟體層才是真正的災難

1

不穩定當機等於反覆被迫斷電: 客戶只能長按電源或直接重開,系統沒有機會正常收尾。
2

更新或寫入中途當機最傷: 會造成檔案系統中繼資料不一致、元件庫與登錄檔半寫入、開機結構受損。
3

損毀是累積的: 一次當機可能自動修復,頻繁當機則讓小錯誤逐次疊加,還製造「是 Windows 壞了」的錯覺,讓人往軟體方向白費力氣,真正的病根(硬體)卻沒處理。
4

修復工具有前提: Windows 10 的就地升級修復(保留檔案與程式的重新安裝)需要相同或更新版本的安裝媒體;品牌機多半沒附還原光碟。
5

驅動程式是隱性資產: 老機型的驅動多是長年累積的特定版本,原廠網站可能已下架,晶片組、儲存控制器、網路卡驅動一旦遺失,即使系統救回也可能無網路、無法開機。
6

沒備份、沒還原點就是終點: 只剩全新安裝:程式重裝、設定重做、授權重找。

軟體端也在淘汰老硬體:驅動與電源管理

前面談的都是硬體在老化,但還有另一半:OS 與驅動廠商為了新硬體的功能,會逐漸放棄老硬體的相容性。兩邊同時夾擊,老機的處境才完整。

✔

驅動程式:新版不再為老硬體驗證。 廠商的測試資源集中在新平台,老型號只做維護。結果是「最新版」不一定最穩,「最舊版」又可能缺少新版 Windows 需要的修正;Windows 10 22H2 搭配 G4600 內顯,到底用舊版某一版還是最新版,常要靠試。
✔

電源管理:睡眠、休眠、喚醒被新機制改寫。 Windows 為新硬體的待機設計與快速啟動調整流程,老主機的睡眠、韌體與 ME 驅動未必跟得上,症狀是睡醒黑屏、喚醒後當機、關機後無法正常再開。
✔

Windows Update 本身: 累積更新會順帶更新驅動與元件,可能把原本穩定的組合換成不穩定的組合,所以會看到「更新完反而變差」。
判讀提醒: DeskMini 110 在 Linux Live 同樣重現當機,而 Linux 用的是完全不同的驅動堆疊。這代表不能把它歸成純 Windows 驅動問題,更偏向底層硬體、韌體(BIOS/微碼)或供電。換驅動版本是低成本的嘗試,卻不能當作結案。

實務做法

1

「已知穩定版本」登錄: 老機在穩定時,記錄 Windows 版本、顯示驅動、晶片組與 ME 驅動版本,並保存安裝檔。這是「前備」概念的延伸。
2

更新前先凍結: 對還要服役的老機,更新驅動或 BIOS 前先確認可回復、備份優先,並預期「更新不一定是改善」。

雙重縮圈:存活區是兩圈的交集

Windows 的支援範圍像遊戲裡不斷收縮的安全圈,硬體本身也在縮圈。客戶實際能安全使用的,只是兩圈重疊的那一塊。

硬體圈 軟體圈
縮的原因 焊點疲勞、電容衰退、韌體資料衰退,是物理老化 OS 支援週期結束、驅動不再為老硬體驗證、瀏覽器與應用程式放棄舊 OS
縮的速度 緩慢、不可預測,個體差異大 由廠商決定,有明確日期
能不能延長 只能靠環境與運氣,無法修復 可以換 OS 來延長
這次案例 ESC500 G4 不開機、DeskMini 不穩 Windows 10 生命週期、第 7 代處理器無法升級 Windows 11
使用提醒: Windows 10 一般支援已於 2025 年 10 月結束,個人版延伸安全更新另有期限;Windows 11 的處理器門檻大致從第 8 代起算。日期與規格正式引用前,請以微軟官方頁面確認。
關鍵推論: 汰換時點不是由壽命較長的圈決定,而是由先縮完的那個圈決定。硬體還能開機,只要軟體圈已沒有安全更新,連網使用就等於暴露;反過來,軟體還在支援期,硬體不穩一樣走不下去。

毒圈與你的專業:資安隔離

遊戲裡待在圈外會持續扣血,老機也是:沒有安全更新的 Windows 連上網路,風險不是「用起來不穩」,而是「被入侵」。

✔

一般客戶: 不要再用這台機器上網處理重要事情,建議汰換。
✔

必須續用的舊系統(綁定舊版軟體的設備、老 PDM/ERP 客戶端): 這時輪到資安閘道器:隔離網路、限制出入、前面加防火牆,把風險關進可控的範圍。這才是這類案子真正值萬元以上的地方。

關於換 Linux

多數客戶不會換,原因通常是應用程式只有 Windows 版,或是操作習慣。還有一個值得寫進去的觀察:換 Linux 只能延長軟體圈,延長不了硬體圈。 DeskMini 在 Linux Live 同樣當機就是證據。它只適合硬體還穩、用途單純的情況,不是萬靈丹,也不該被用來替「繼續搶救」找理由。

對客戶的白話說法

「電腦像在玩一個會縮圈的遊戲:硬體在老化縮圈,軟體廠商也在縮圈。兩個圈疊在一起的安全區,每年都在變小。這台機器現在不是只有硬體不穩,系統本身也快要沒有人照顧了。留在圈外,就像站在毒圈裡,只是時間問題。」

設備老化,很像三高

會送修八年電腦的客戶,通常也有些歲數,三高與血管硬化是他們熟悉的語言。這個比喻補上了「老房子」缺的一塊:慢性、無症狀、累積,然後突然發作。 老房子漏水看得見,三高和老硬體一樣,平常都「能用」,出事時是急性發作。

人體 老硬體
血管硬化、管壁變窄 焊點微裂、金手指氧化、接觸電阻變大,導通路徑變差
膽固醇斑塊堆積 積塵、氧化層、電解電容乾涸,慢慢堆出的「阻力」
高血壓:心臟要用更大的力才推得動 供電電路為維持輸出,長期承受更大負擔
心臟不能無上限加壓 電源供應器與 VRM 有額定上限,不能靠加大功率補償老化
高血糖、高血脂:長年悄悄傷害微血管 長期高溫高負載的微小損傷累積,平時不顯症狀
心肌梗塞、中風:突然發作 突然不開機、無過電反應、開不進系統
平常沒感覺,檢查才知道 SMART、事件檢視器、SFC/DISM 紀錄
支架、繞道手術 換電容、reflow、換硬碟,延長一段時間
心臟移植 整機汰換

這個比喻還能多說三件事

1

壓力測試本身有風險: 就像高風險的人做運動心電圖,要在有急救準備時做。對老機,燒機可能就是壓垮它的最後一根稻草,所以規則是「先備份,再壓力測試」。
2

到了年紀不等於一定出事,但風險明顯上升: 八年是「預警與規劃」的時點,不是「宣判」的時點。這呼應對已佈建客戶的做法:定期檢查,不等發作才處理。
3

預防比搶救便宜: 定期健檢、備份、預先換硬碟,對應的就是三高管理;客戶接受「定期健檢」的概念,比接受「維護合約」容易。
使用邊界: ① 人體會自我修復,電路板不會,硬體老化不可逆,比喻到這裡要停,不要延伸成「保養就能救回來」,否則客戶又會要你「再試試看」。② 比喻的對象是機器,不是對方的身體,點到為止,不評論對方的健康。
「設備老化很像人到了一個年紀,不是某個地方壞了,而是整個系統都在慢慢退化:血管變窄、心臟負擔變大,平常沒感覺,檢查才看得到,發作的時候卻是突然的。所以重點不是等發作再搶救,而是平常定期檢查、做好備份,讓它真的出事時,你的損失已經被控制住了。」

有數位授權、能重灌,也不等於沒事

授權只解決「合法」的問題,不解決「時間」與「相容」的問題:

✔

ISO 是舊的快照: 下載的 Windows 10 ISO 停在某個累積更新的時間點,裝完要經過多輪 Windows Update 才追得上現況,中間常有重新啟動、更新失敗、回復變更。
✔

老機器跑更新特別慢: 傳統硬碟的八年舊機,一輪更新往往以小時計,而且常要反覆多輪。
✔

更新本身就是高風險動作: 在一台本來就會當機的機器上連續更新數小時,等於把最危險的操作做上好幾小時;裝到一半當機,就得從頭再來。
✔

驅動要逐一對上: RAID/儲存控制器、舊款網卡、顯示卡、指紋辨識、品牌專屬電源與熱鍵管理、擴充卡,常需原廠驅動;老機型的頁面可能已下架,或只提供 Windows 7/8 版本。
✔

程式與設定全部歸零: 應用程式要重裝、授權要重新啟用、設定要重建,客戶自己通常說不清楚有哪些,用了才發現少東西。
順序固定為:先備份資料,再說明老化,最後建議換新機。 對家用客戶,這比講焊點與電容更有行動力,因為它把決策從「要不要放棄舊電腦」變成「資料要不要現在保住」。

怎麼讓客戶「死心」:症狀對得上、說法聽得懂、口吻要堅定

家用客戶捨不得的往往不是機器,而是「花過錢的東西就這樣報廢」的感覺。你的猶豫會被當成還有希望,所以要先講症狀,再講原因,最後講結論,結論前不加「可能」「也許」。

核心比喻:電腦像一棟八年的房子

電腦不是一個零件壞掉,而是整塊電路板都用了八年。就像老房子,你換掉一條水管,旁邊的電線和牆壁還是八年的舊。修好這一處,下一處很快出問題,而且每次都是在你最需要用的時候。

症狀對照表

客戶描述的症狀 背後的老化原因(白話版)
不定期當機、藍畫面 供電元件(電容、電感)老化,電流一有變化就撐不住,跟軟體無關
開機要按好幾次才成功 晶片底下的焊點出現細微裂痕,冷熱一變化接觸就時好時壞
開機完全沒反應、沒有燈 電源供應器或主機板供電電路已失效
有燈有風扇但沒畫面 記憶體插槽接觸不良、記憶體老化,或主機板晶片失效
重灌後還是不穩 問題在硬體,換什麼系統都一樣
溫度看起來正常卻還是當機 溫度感應器只量一個點;老化的是焊點與電容,和溫度無關
電腦變慢、偶爾卡死 硬碟或記憶體老化,資料讀取開始出錯

三句堅定的話

「你描述的不定期當機,是老化硬體的典型症狀,不是軟體問題。」 「這不是單一零件壞掉,是整塊板子八年的疲勞,換同樣老的零件,只是把問題往後延。」 「我的建議很明確:先把資料完整備份出來,這台不值得再投資,把預算用在新機上。」

對「捨不得」的回應

客戶說 回法
可是它當年很貴 當年的價格買到的是這八年的使用,它已經完成任務,每年成本算下來並不高。
能不能再試試看? 可以試,但先講清楚:即使這次修好,下次不穩還是會出現,而且沒有保固。你要的是穩定,不是再賭一次。
只是換個零件而已吧? 問題不是一個零件,是整塊板子的壽命。
有授權,重灌就好吧? 重灌不是按一下就好:舊版安裝檔要更新很久,更新時最怕當機,您這台正好就會當機,特殊零件還要另找驅動。
資料會不會不見? 資料在硬碟,不在主機板。我先幫你完整備份,這是最重要的。

適用範圍:前備分級與企業例外

真正的分水嶺不是機齡,也不只是業務衝擊,而是前備工作有沒有做。我能在災害當下接手、或預先更換老硬碟,靠的是事前做好的整套設計:NAS、防火牆、外接硬碟、異地備份。有這層防護網,搶救才有退路,BMR 失敗還有其他備份可轉。那兩台老電腦的客戶什麼都沒有,所以只能事後硬救,成功率與報酬都最低。

等級 條件 處置
一、已佈建客戶 備份、防護(NAS、防火牆、外接硬碟)、異地備援都已設計到位,平常有定期照顧 主動預警、預先更換老硬碟、災害當下全力接手;費用以萬元計
二、部分佈建 至少有可還原的備份 先驗證備份可還原,再依階段關卡報價處理
三、無前備(親友鄰居、家用) 沒備份、沒還原點、沒人追蹤健康狀態 兩小時停損、資料優先、建議汰換,並導向「備份入門配置」
搶救能力不是臨場技術,而是事前投資的結果。 沒有前備的案子,只能做資料優先與建議汰換;有前備的案子,才有資格談搶救與分階段報價。

企業關鍵系統(PDM、ERP):不是停手,是設關卡

七八年的 PDM、ERP 主機出現警訊,逼迫業主更換伺服器硬碟,技術費以萬元為單位,費率與價值對得上,這與修家用電腦是不同類型的工作。2 小時上限在這裡改成「階段關卡」,每一關都要客戶簽核才往下走:

1

診斷關: 只做健康評估(SMART、事件紀錄、備份是否可還原),產出一頁風險報告;這一關維持時間上限。
2

方案關: 至少提出兩案報價,例如「只換硬碟,撐住」對「整機汰換或虛擬化遷移」,並寫明各自風險與停機窗口。
3

執行關: 客戶書面同意範圍與費用後才動手;超出範圍就回到方案關重新報價。要熬夜,也是排定維護窗口、有人接手、有收費,而不是一個人硬撐。

企業專屬規則

1

先驗證備份能還原,再碰任何硬體。 備份存在不等於可還原。
2

同齡硬碟要當成一批看待。 同時間出廠的硬碟,因負載不同,健康度可能落差極大;換掉壞的那顆,另一顆也要列入觀察。企業級硬碟有五年保固,不代表可以忽略健康趨勢。
3

只換硬碟是補丁,不是解法。 七八年的伺服器,其他零件跟硬碟一樣老;報價時同時把整機汰換方案放上桌,並給時間表。
4

預警要制度化。 定期(每季或每半年)提出硬碟與備份狀態報告,讓換機變成預算內的計畫,不是半夜的緊急事件。
5

PDM/ERP 的授權與資料庫先盤點。 授權是否綁硬體、資料庫版本能否遷移、換機要停機多久,先弄清楚才報得出可信的價格。
6

「看起來好了」在伺服器上更危險。 換完硬碟、還原成功不等於穩定,要觀察一段時間,並明確告知客戶殘餘風險。
7

設備清冊記錄三個欄位: 硬體出廠年、OS 支援截止日、最後可用(已知穩定)的驅動版本,讓汰換時點提前排進預算。
8

前備與定期檢查要明確化。 若這些事前工作靠平常的人情照顧,預先換硬碟的時間就成了免費的善意投資;建議以維護合約或固定服務明列。
企業案子的急迫感,會讓「想救」的本能找到更正當的理由。 階段關卡與維護窗口正是煞車。過去一案現場三趟、換兩顆碟,異機 BMR 失敗、現場無網路、小檔案複製耗一整晚,這些都是範圍外的隱性成本,有關卡才有地方收費。

停損原則(由緊而寬)

以下規則主要適用第三級(無前備)客戶,以及其他等級的診斷關。「緊」的是不容協商的硬性規則,「寬」的是可以彈性運用的做法。

給工程師(自己)

1

不穩定機器先搶資料,後談診斷。 有不定期當機、BSOD 或更新中斷的紀錄,第一步一律完整備份(必要時用 Live USB 直接複製,不進入原系統),備份完成前不做任何修復動作。
2

接案先問症狀,不先看機器。 動手前固定問完上面的問診題;任一題答「是」,加上機齡超過八年,直接進入「備份資料、建議汰換」,不進入搶救流程。
3

單案診斷上限 2 小時。 時間一到,無論有沒有結論,都進入汰換建議。
4

沒有客戶同意,不做延伸。 超過 2 小時的動作必須先取得同意;聯絡不上客戶時,預設是「停」,先收尾,再以留言或簡訊告知現況與選項。
5

不在不穩定的舊機上做長時間重灌與更新, 除非另行報價並讓客戶接受風險。
6

固定四步,不展開臆測: 換電源、清 CMOS(換電池)、最小系統、換 RAM 交叉。四步做完仍異常就停;BGA、SPI Flash、VRM 屬於需要專業設備或換板的範圍,不在服務內。
7

「看起來好了」不算結案。 要宣告修好,必須跑完壓力測試(memtest 多輪加上 CPU 與磁碟負載數小時),讓機器自己跑,我去做別的事。
8

不熬夜。 晚上 9 點後不開始新的診斷。通宵換來 NT$1,200 以內的收入,卻要用隔天的狀態與健康來付帳。
9

先算放棄價,停手要收尾。 先寫下這案最多收多少,再以 NT$2,500/hr 反推願意投入的分鐘數(通常 30~60 分鐘);停手時完成資料交還與一頁檢測摘要,不留「再試一下」的尾巴。

給客戶(尤其是親友鄰居)

1

事前聲明: 「超過八年的電腦,我只做兩小時的基本檢測。找不到明確原因就建議換新,因為老機再修,下一次故障只是時間問題。」
2

資料優先於機器: 客戶真正在意的往往是資料,先確保資料搬得出來,比救機器重要。
3

基本檢測就收費: 哪怕只有 NT$300 也要收;如果是人情,也講明「這是人情,不是服務」。
4

延伸檢測與重灌,先報價、先同意: 發現有進展的當下就告知「有機會修好,但需要再花幾小時驗證穩定性,費用是 X」。
5

給有限的選項: A. 基本檢測;B. 直接建議配置新機;C. 只協助資料搬移。選項有限,對方就不會一直要求「再試試看」。
6

以汰換建議收尾: 附一頁檢測摘要(做過哪些處理、哪些已排除),用保固與可預期性說明為什麼換新比找同期零件合理。
7

把備份入門配置當作出口: 「這次來不及了,但換新機的時候,我幫你把備份裝好(外接硬碟加自動備份),下次出事就不用再賭。」
8

對「捨不得」的回應固定說法: 不靠臨場意志力,靠熟練的話術。放棄不再是「我救不了」,而是「我做出了專業判斷」。
一句話版本|超過八年的機器,兩小時為限;先救資料;沒有客戶同意,不做延伸;「看起來好了」不算結案,壓力測試過才算。

附註:系統紀錄中的毀損證據

使用提醒: 以下部分錯誤碼與訊息字串為經驗整理,正式引用前請對照實際機器的 log,以親眼見過的為準。

附註一:紀錄位置

SFC 細節:C:\Windows\Logs\CBS\CBS.log
抽出 SFC 行:findstr /c:”[SR]” %windir%\Logs\CBS\CBS.log > sfclogs.txt
DISM:C:\Windows\Logs\DISM\dism.log

附註二:最常見的毀損區域

名詞 白話意思
WinSxS(元件存放區) 系統元件的原廠備份倉庫;倉庫本身壞掉,SFC 無從修復
Manifest / Package(.manifest、.mum、.cat) 描述元件內容與簽章的清單;毀損則系統不認得該元件
COMPONENTS 登錄檔 hive 記錄元件狀態,更新中途當機最易受損
Servicing Stack / TrustedInstaller 負責安裝與修復更新的機制,異常時連修復工具都跑不動
pending.xml 更新做到一半的未完成清單,殘留會反覆卡在「正在還原變更」
Catalog(.cat)簽章 驗證檔案真偽,遺失或不符即判定毀損
NTFS 中繼資料($MFT、$LogFile) 檔案系統目錄與日誌,被強制斷電破壞後出現檔案無法讀取或消失

附註三:SFC / DISM 常見訊息與錯誤碼

訊息/代碼 意義 對應因素
Windows Resource Protection found corrupt files and was unable to fix some of them 發現毀損但無法修復 長期毀損累積;倉庫本身可能已壞
Cannot repair member file … file is missing 倉庫裡的原件遺失 元件庫損毀或更新中斷
Hashes for file member … do not match 檔案內容與原件不符 寫入中斷、記憶體或儲存錯誤
Repair failed: Missing replacement payload 找不到替換用的修復檔 倉庫缺件,需外部媒體
Manifest corrupt / CSI Payload Corrupt 清單或元件內容毀損 更新中途斷電
The component store is repairable 倉庫已受損 累積性毀損
0x800f081f 找不到修復來源 缺對應版本安裝媒體(品牌機無還原光碟)
0x80073712 元件存放區毀損或元件遺失 更新中斷、倉庫損毀
0x800f0831 缺少前置更新包或清單 更新鏈不完整
0x80070570 檔案或目錄毀損無法讀取 檔案系統或磁碟問題
0x80070017 CRC 錯誤 偏向儲存媒體本身
0x8007045d I/O 裝置錯誤 同時懷疑硬碟、排線、控制器

附註四:硬體層佐證(事件檢視器 → Windows 記錄 → 系統)

來源/事件 意義
Kernel-Power 41 系統未正常關機即重新啟動(斷電、硬當機)
EventLog 6008 上次關機為非預期
Disk 7、11、51、153 壞區塊、控制器錯誤、分頁 I/O 錯誤
WHEA-Logger 17、18、19 硬體錯誤回報(處理器、匯流排、記憶體相關)
BugCheck 1001 藍畫面紀錄與停止碼

附註五:判讀的邊界(讓證據站得住腳)

1

能證明的: 這台機器長期處於不穩定狀態,系統毀損已累積多年,並非新發生。
2

不能單憑 SFC/DISM 證明的: 毀損由哪個零件造成。強制斷電、記憶體錯誤、硬碟壞軌都會留下相同訊息,需用附註四的事件與壓力測試交叉佐證。
3

修復成功不等於痊癒: SFC/DISM 只補回已壞的檔案,硬體病根還在,之後仍會寫入新的毀損。

附註六:給客戶的白話說法

「我看了系統的檢查紀錄,裡面累積了好幾年的檔案毀損記錄,還有多次非正常關機的紀錄。這表示電腦不是今天才不穩,而是長期當機、被迫重開,系統內部的資料表一直被弄壞。我可以把壞掉的檔案修回去,但只要硬體還是不穩,修好的地方很快又會壞。現在最重要的是先把資料備份出來。」

附註七:Windows 10 當機前後會留下什麼紀錄(DeskMini 查證用)

使用提醒: 事件編號與路徑為經驗整理,實際以該機器事件檢視器所見為準。硬當機(凍結、被迫斷電)時,Windows 來不及寫下「為什麼」,通常只留下「不正常結束」這個事實,以及當機前零星的前兆。

(一)當機後開機,一定會有的紀錄(事件檢視器 → Windows 記錄 → 系統)

來源/事件 意義
Kernel-Power 41 系統未正常關機就重新啟動。看詳細資料的 BugcheckCode:0 表示沒有藍畫面(純斷電、凍結或硬重置),非 0 才是藍畫面
EventLog 6008 上次關機為非預期,並記下上次正常運作的最後時間
EventLog 6005/6006 事件記錄服務啟動與停止,用來排時間軸

Kernel-Power 41 的詳細資料裡有 PowerButtonTimestamp:非 0 代表有人長按過電源鍵(畫面凍結後手動關機);0 偏向機器自己重置或瞬間斷電。這一欄能直接回答「凍結還是自動重開」。

(二)當機之前,可能已寫入的前兆(往當機時間點之前翻)

來源/事件 意義
WHEA-Logger 17、18、19 硬體錯誤回報:處理器、匯流排、記憶體相關,含已被修正的錯誤
Disk 7、11、51、153;storahci 129 儲存裝置壞區塊、控制器錯誤、重置,指向 SSD 或排線
Display 4101 顯示驅動停止回應後恢復,與顯示路徑相關
Kernel-Processor-Power 37 CPU 效能被韌體限制,供電或熱保護線索
Application Error 1000、Application Hang 1002、WER 1001 程式當掉或卡死;WER 1001 若為 LiveKernelEvent,是核心層級的硬體或驅動逾時

也可以執行 perfmon /rel 開啟「可靠性監視器」,它把這些事件整理成時間軸,客戶也看得懂。

(三)藍畫面才有的紀錄

✔

C:\Windows\Minidump,以及 C:\Windows\MEMORY.DMP(前提是系統設定有開啟傾印)。
✔

系統記錄中的 BugCheck 1001,含停止碼。
✔

凍結型當機不會有這些,所以找不到不代表沒事。

(四)判讀的限制

供電瞬間掉電、或晶片組致命錯誤造成立即重置時,當下什麼都寫不出來,系統記錄只會有 Kernel-Power 41,前面往往也很乾淨。所以「事件檢視器很乾淨」不能證明硬體沒問題;反過來,前面若出現 WHEA 或 Disk 紀錄,就是很有力的證據。

(五)一次抽出相關事件(系統管理員 PowerShell)

Get-WinEvent -FilterHashtable @{LogName=’System’; Id=41,6008,1001,17,18,19,7,11,51,153,129,4101,37; StartTime=(Get-Date).AddDays(-2)} | Sort-Object TimeCreated | Format-Table TimeCreated,Id,ProviderName,Message -Wrap

順手檢查系統時間有沒有被重置:時間跳回早期日期,是 CMOS 電池或主機板即時時鐘的線索。

(六)下次測試前,可以預先佈置

1

HWiNFO 開啟「記錄到檔案」: 當機後,最後幾秒的溫度、電壓、電流還留在 CSV 裡,這是目前最能補上「當機前一刻」的方法。
2

關閉「系統失敗時自動重新啟動」: 若是藍畫面,畫面才會停住讓人看到停止碼。
3

確認傾印設定為小型傾印: 藍畫面時才會留下檔案。

(七)判讀方向(僅供參考)

觀察到 偏向
只有 Kernel-Power 41,BugcheckCode = 0,前面乾淨 供電瞬斷或晶片組致命錯誤,也可能是凍結後手動關機
前面有 WHEA 17/18/19 硬體層錯誤:記憶體、CPU、匯流排都可能
前面有 Disk 或 storahci 錯誤 儲存裝置或排線(目前尚未排除的一條)
前面有 Display 4101、LiveKernelEvent 顯示驅動或內顯路徑
有 BugCheck 1001 藍畫面,用停止碼與傾印進一步判讀

(八)DeskMini 三次當機的對照欄位(待填,尚未查證)

當機 發生時間 Kernel-Power 41 的 BugcheckCode PowerButtonTimestamp 當機前的前兆事件
第一次(算圖完成後) 未記錄 未記錄 未記錄 未記錄
第二次(測試跑完後) 未記錄 未記錄 未記錄 未記錄
第三次(MotionMark 1.2 途中) 未記錄 未記錄 未記錄 未記錄

這張表刻意留白:沒有查證的內容不寫進結論。填完之後,才能判斷是凍結還是重置,以及前面有沒有硬體或儲存的前兆。

#老舊硬體#停損#SFC#DISM#接案問診#資料優先#前備分級#階段關卡#DeskMini#雙重縮圈#三高比喻#穩定性觀察
作者|Mr. τ / 風雲網通系統
Last modified: 2026-10-02

Author

Comments

Write a Reply or Comment

Your email address will not be published.