科技冷知識:為什麼硬碟明明「複製成功」,換上去卻藍屏?
科技冷知識:為什麼硬碟明明「複製成功」,換上去卻藍屏?

💡 科技冷知識:為什麼硬碟明明「複製成功」,換上去卻藍屏? PCPiLOT 工程師思路系列・事出必有因 / Mr. τ・風雲網通系統 大家換硬碟時,有沒有遇過這種崩潰場景? 硬碟已經完整複製。 分割區也看起來都正常。 檔案一個不少。 結果一換上新硬碟,Windows 開機直接: 💥 BSOD 💥 0x7B 💥 INACCESSIBLE_BOOT_DEVICE 這其實是老 IT 人很熟悉的一種問題。 從早期的 IDE → SATA,到後來 SATA/AHCI → NVMe,雖然底層架構並不完全相同,但有一個共同點: 「Windows 找不到自己原本的開機磁碟。」 Data ≠ Boot 硬碟裡的檔案可以全部複製成功,但 Windows 要能開機,靠的不是「資料在不在」,而是這整條鏈能不能接起來: Firmware ↓ Boot Manager ↓ BCD ↓ Storage Controller ↓ Driver ↓ Windows 任何一層斷掉,都可能藍屏。 ❌ 為什麼會這樣? 因為 Windows... » read more

散熱崩潰的連鎖效應:從 21 年老冷氣到 IT 設備的共同命題
散熱崩潰的連鎖效應:從 21 年老冷氣到 IT 設備的共同命題

散熱崩潰的連鎖效應:從 21 年老冷氣到 IT 設備的共同命題 工程師思路系列 · 事出必有因 | Mr. τ · 風雲網通系統 今天換了一顆冷氣室外機風扇馬達,讓我想到一件事—— 不管是 21 年的老定頻冷氣,還是機房裡的伺服器、NAS、交換器: 散熱系統的衰退模式,幾乎是同一套劇本。 🔧 今天發生的事:培林異音與馬達更換 家裡那台用了 21 年的三葉定頻冷氣,室外機風扇培林異音大到讓我不好意思開機。昨天嘗試自行拆解清潔,但缺乏衝擊電動起子,馬達紋絲不動。問了原廠台中分公司報價後,決定請專業師傅處理。 今天師傅電話一到,約一小時完工。更換的馬達規格: ▸ 單相 / 6P ▸ 50W / 220V ▸ 電容:2.5µF 450V ▸ 保固:三個月 但這件事真正讓我想聊的,不是維修本身——而是「培林磨損」這個小故障,在系統層面造成的連鎖崩潰邏輯。而這個邏輯,和我在 IT 第一線每天面對的設備散熱問題,幾乎如出一轍。 🌡️ 一顆培林,如何讓整台冷氣「內傷」 多數人聽到培林異音,第一反應是「吵到受不了」。但從熱力學與冷凍循環的角度來看,噪音只是表象,真正的問題是風量崩潰引發的系統性失衡: 1 風量與風壓的雙重崩解 軸承阻力增加、轉速下滑,冷凝器通過的風量(CFM)大幅縮水。單位時間內能帶走的熱能嚴重不足。 ↓ 2 冷凝壓力惡性飆升(High Head Pressure) 高壓高溫冷媒無法在冷凝器順利液化,冷凝壓力與溫度異常衝高,系統高壓側瀕臨紅線。 ↓ 3 壓縮機過載運轉... » read more

別急著換電腦:Chrome 的隱性淘汰機制,與老硬體的「軟體大逃殺」
別急著換電腦:Chrome 的隱性淘汰機制,與老硬體的「軟體大逃殺」

別急著換電腦:Chrome 的隱性淘汰機制,與老硬體的「軟體大逃殺」 工程師思路系列・事出必有因 / Mr. τ・風雲網通系統 | 2026-08 一台 Xeon E3-1230 v3 的老主機,搭配著有些年紀的獨立顯卡。Chrome 開 Google Maps,切到衛星圖層或 3D 檢視,瀏覽器分頁甚至 GPU Process 直接崩潰。 奇怪的是——Windows 正常跑。一般網頁正常開。Office 沒有問題。這台電腦也沒有突然變慢。 答案不是「電腦壞了」。而是一個更值得注意的現象正在發生:老硬體正在經歷一場軟體生態的「大逃殺」。 🔍 為什麼 Google Maps 特別容易暴露問題? 現代 Google Maps 不是把一張圖片顯示在瀏覽器裡而已。衛星圖磚、3D 地形、縮放旋轉、材質渲染,全都走瀏覽器的 GPU rendering pipeline——涉及 WebGL、WebGPU、GPU compositing、rasterization 等多個環節。 一張十幾年前仍然可以正常輸出 Windows 桌面的顯卡,不代表它能穩定處理今天瀏覽器所使用的每一種 GPU 工作負載。 重要釐清:不是 Chrome 把一串「新指令」直接丟給老顯卡。而是現代 Chromium 的圖形處理路徑越來越複雜,老 GPU、老驅動與特定 rendering backend 的組合,逐漸出現相容性邊界。NVIDIA Fermi 世代(如... » read more

工程師手記:一顆瑕疵硬碟的「好區分割」實錄
工程師手記:一顆瑕疵硬碟的「好區分割」實錄

工程師思路系列・事出必有因 工程師手記:一顆瑕疵硬碟的「好區分割」實錄 用 AI 協助開發一套把壞區封印、好區留下的工具鏈 作者:Mr. τ / 風雲網通系統有限公司(PCPiLOT) 有時候,工程師會做一些很「客家」的事情。 不是因為買不起新的,而是看著一顆還能讀、還能轉、還能跑的老硬碟,心裡總會冒出一個問題: 「它真的已經完全沒有利用價值了嗎?」 這次的專案,就是從這個問題開始的。 一、問題從哪裡來 一般遇到硬碟出現壞軌,最標準的建議其實很簡單:備份資料、更換硬碟、淘汰。 這個答案沒有錯。尤其是企業伺服器、資料庫、NAS 等重要設備,硬碟一旦出現大量重新配置磁區、Pending Sector 或 Uncorrectable Sector,根本不應該拿來賭。 但是,如果今天手上的硬碟只是在某些區域出現瑕疵呢? 例如: 前面一大段可以正常讀取 中間有一段連續的問題區域 後面又有很長一段可以正常讀取 這顆硬碟不是「全部壞掉」,而是只有一部分不能用了。 於是我開始思考:如果可以把壞掉的區域隔離起來,只把確認可以正常使用的區域建立成 partition,是不是就能讓這顆硬碟繼續承擔一些低風險用途? 二、現有工具為什麼不夠用 一開始我也認為「這應該早就有人做了吧?」 畢竟 Linux 有 badblocks、有 SMART 工具、有 ddrescue、有各種 HDD surface scanner,也有非常成熟的 partition 工具。把它們組合起來,應該就完成了。 但仔細研究之後,才發現事情沒有那麼簡單。 現有工具大多各自解決一個問題: badblocks:找出有問題的 block smartmontools:分析硬碟健康狀態 ddrescue:在硬碟快壞掉時,盡可能把資料救出來 diskpart、fdisk、parted:建立與管理 partition 但我要做的事情其實不太一樣。 我不是要「修復硬碟」,也不是要「搶救資料」。 而是想做:找出還可以使用的區域,然後把不能使用的區域隔離。 不是把壞硬碟修好,而是重新定義這顆硬碟「哪些地方可以用」。... » read more

工程師手記:老舊交換器過熱改善實錄
工程師手記:老舊交換器過熱改善實錄

工程師思路系列・事出必有因 工程師手記:老舊交換器過熱改善實錄 用簡單熱橋重拾金屬殼體的散熱價值 作者:Mr. τ / 風雲網通系統有限公司(PCPiLOT) 在網路設備的日常維護中,我們經常會遇到一些「設計上留下遺憾」的老設備。 最近處理一台使用多年的 Zyxel GS108B 時,就遇到典型的過熱問題——而解決方法,比想像中簡單。 一、問題從哪裡來 長時間運作後,這台 GS108B 機殼明顯發燙,內部溫度偏高。雖然尚未直接影響功能,但已明顯超出理想工作範圍。 原廠設計僅在主晶片上黏貼一顆鋁擠型散熱片,整個金屬殼體幾乎沒有被納入散熱路徑。這讓人不禁思考:既然外殼本身就是大面積的金屬結構,為何沒有好好利用? 二、問題分析 拆開機殼後可以清楚看到: • 主晶片上方有一顆標準鋁散熱片 • 散熱片與上蓋之間存在明顯空隙 • 熱量主要只能透過空氣對流與有限的殼體傳導排出 這種設計在產品初期或許足以應付一般負載,但隨著使用年限增加、環境溫度變化,或是設備長期處於較高流量狀態時,散熱裕度就顯得不足。 三、改善思路 傳統做法多半是在殼體上開孔加裝風扇,但這會帶來幾個問題: • 破壞原有外觀與結構完整性 • 增加噪音與灰塵進入的風險 • 對老舊設備來說,加工難度與風險都偏高 因此我們選擇另一條路: 「不破壞外殼,直接建立從散熱片到上蓋的熱傳路徑。」 四、實作方法 材料很簡單,使用早期桌上型電腦擴充槽的後擋板(單片馬口鐵),具備以下優點: • 厚度適中、易於加工 • 導熱性雖不如純銅,但對此應用已足夠 • 取得容易,成本極低 加工步驟如下: 1 以鉗子將馬口鐵折成兩個對稱的「ㄇ」字形結構 2 仔細調整高度,使其在合上上蓋時,能同時對散熱鰭片施加適當壓力,並與上蓋內側形成良好接觸 3 在接觸面(散熱片與鐵片、鐵片與上蓋)均勻塗抹散熱膏 4 確認組裝後無鬆動、無過度壓迫 PCB 的情況... » read more

同齡不同命:PDM 伺服器硬碟故障全記錄
同齡不同命:PDM 伺服器硬碟故障全記錄

工程師思路系列 · 事出必有因 同齡不同命:PDM 伺服器硬碟故障全記錄 兩顆同批硬碟、截然不同的 S.M.A.R.T. 數據,說明了一件事—— 客戶的 PDM 主機頻繁出現 BSOD,三趟現場、兩顆硬碟更換、一次與故障碟搶時間的緊急救援——這篇文章完整記錄過程與教訓,以及這個案例如何成為我們開發硬碟分析工具的直接動機。 伺服器硬碟配置 磁碟 型號 用途 最終狀態 Disk 1 Seagate Exos E7B 2TB C:(Windows Server 2016)+ E:(備份區) 健康,無明顯瑕疵磁區 Disk 2 Seagate Exos E7B 2TB Oracle 資料庫 + PTC Windchill / Creo 設計檔案 瑕疵磁區數以萬計,已嚴重劣化 兩顆硬碟同型號、同時間採購上線,帳面上應該「狀況差不多」。實際展開 S.M.A.R.T. 數據後,結果令人震驚——兩顆同齡的硬碟,健康落差大到像是相差了好幾個世代。 「同齡不同命」——Workload Rate Limit 沒說的那件事 廠商的 Workload Rate Limit(年工作量上限)衡量的是「搬運了多少資料」,而不是「磁頭來回了幾次」。 Disk... » read more

企業資料庫儲存設備健康評估案例: 硬碟不是突然故障,而是被工作負載慢慢磨損
企業資料庫儲存設備健康評估案例: 硬碟不是突然故障,而是被工作負載慢慢磨損

硬碟不是突然故障,而是被工作負載慢慢磨損 一次企業資料庫儲存設備健康評估案例 在企業 IT 環境中,硬碟故障往往不是發生在「完全沒有預警」的瞬間。 更多時候,設備早已透過各種訊號告訴我們: 它正在老化。 只是企業通常看到的是: 「系統還能運作。」 而不是: 「設備是否已經進入高風險階段?」 近期一次企業核心系統健康評估案例中,我們分析了一組長期承載資料庫服務的機械硬碟。 這組設備具有非常難得的比較條件: 同一批採購 同一台伺服器 接近相同服役年資 相同機房環境 但最後結果卻非常不同。 其中一顆硬碟仍維持正常狀態,另一顆則已出現嚴重健康警訊。 工程觀察: 硬碟壽命,不只是由「使用時間」決定,而是由「使用時間 × 工作負載」共同決定。 一、同樣服役多年,為什麼硬碟健康狀態差異巨大? 此次評估對象是一台企業級機架式伺服器,主要承載: 企業資料庫系統 產品資料管理(PDM)平台 工程文件與產品生命週期資料 伺服器內兩顆硬碟原本就有不同任務分工。 第一顆硬碟: 主要負責作業系統、系統環境與備份相關工作。 第二顆硬碟: 負責資料庫核心資料,包括交易紀錄、索引資料、關聯結構與大量查詢工作。 兩者看似都是「硬碟」。 但是實際承受的工作型態完全不同。 系統碟: 較接近穩定、循序、大區塊資料存取。 資料庫碟: 長期承受高頻率、小區塊、隨機存取。 而這正是機械硬碟最重要的差異來源。 二、資料讀寫量不是硬碟磨耗的唯一答案 很多人判斷硬碟壽命時,第一個想到的是: 「這顆硬碟寫了多少資料?」 但對機械硬碟而言,這並不是完整答案。 在此次案例中,兩顆硬碟累積寫入量接近。 但是資料庫硬碟的累積讀取量,達到系統碟數十倍以上。 為什麼? 因為資料庫工作模式與一般檔案儲存完全不同。 連續讀取:低物理壓力 例如企業備份: 一次讀取大型映像檔,磁頭找到位置後,可以長距離連續讀取。 這比較像: 一次搬大量貨物,送往同一個地址。 隨機讀取:高物理壓力 資料庫查詢則可能需要快速尋找:... » read more

工程師思路系列・事出必有因: 當 SMART 亮紅燈,工程師看到的不只是壞掉的硬碟
工程師思路系列・事出必有因: 當 SMART 亮紅燈,工程師看到的不只是壞掉的硬碟

工程師思路系列・事出必有因 一顆硬碟的遺言 當 SMART 亮紅燈,工程師看到的不只是壞掉的硬碟 Mr. τ | 風雲網通系統有限公司 · 2026 年 7 月 · 閱讀時間約 8 分鐘 接到電話的時候,已經是下午了。 對方是台中一家自動化機械設計公司的負責人,語氣有些急:「工程師說伺服器怪怪的,你可以過來看一下嗎?」 出門前,我把診斷隨身碟、備援硬碟、萬用電表、起子、網路線一件件放進工具箱。每次遇到這種電話,我都不知道今晚幾點回公司。路上順手買了一罐提神飲料。 到了現場,把診斷隨身碟插進前面板的 USB。沒有反應。換到後面板,才順利開機進入診斷環境。 大多數人看到的是:USB 壞了。 我看到的是:這台機器已經老化到開始出現第二層症狀了。 答案後來出來了——車程不計,現場停留時間:5 小時 13 分鐘。 SMART 亮了什麼燈 執行硬碟健康診斷後,畫面上出現了這一行: SMART overall-health self-assessment test result: FAILED! Drive failure expected in less than 24 hours. SAVE ALL DATA. 不是警告,是宣判。預計 24 小時內故障,請立即備份所有資料。 幾個關鍵數字: 22,984 重新分配磁區數(壞軌數,正常應為 0)... » read more

用 AI 協作把工程師的「工人智慧」,轉換成自動化工具
用 AI 協作把工程師的「工人智慧」,轉換成自動化工具

工程師思路系列 SpanExtract · HDD Rescue 削掉受傷的地方,剩下的還是好的 用 AI 協作把工程師的「工人智慧」,轉換成自動化工具 水果有些磕碰,削開果皮,果肉不好看。只要整體沒有腐壞,大多數人不會整顆丟掉——把瑕疵處切除,剩下的部分,仍然可以食用。 中古硬碟的道理,其實也是如此。 硬碟漲價的壓力,讓人重新看待手邊的舊硬體 最近 CPU、RAM、SSD、HDD 都在漲價。手邊累積多年的 3.5″ 與 2.5″ 硬碟,開始重新值得被認真評估。 真正壞到無法挽救的,早就拆下強力磁鐵,或是送去資源回收了。但有些硬碟的狀況並非「全死」——它們可能只是局部磁區異常、少數區域速度下降、或是邊緣扇區出現不穩定反應,整體仍有相當比例的可用容量。 問題在於:沒有一個有效的方法,把「堪用的部分」精確找出來。 以前靠工人智慧,現在想讓工人智慧變成程式 過去處理中古硬碟的流程,我一直用同一套手動方法: 1 使用 Victoria 進行全碟掃描,取得壞軌位置、延遲區域、讀取異常分布。 2 人眼綜觀掃描結果,加上磁區位置定位,以工程師的現場經驗,判斷哪些區域堪用、哪些區域必須隔離。 3 用硬碟分割工具手動建立多個分割區,分開管理堪用區與隔離區。 這套流程的核心,從來不是「掃描」。掃描只是收集資料。 真正困難的是「判斷」——而那個判斷,長期以來只存在於工程師的腦袋裡。 資深工程師看到同一份掃描報告,可以立刻判斷「這顆還能用」。但新人看到同樣的資料,不知道哪些錯誤嚴重、哪些可以接受、壞區位置代表什麼意義。 因為真正重要的知識,不在工具裡。而是在人的腦袋裡。 把判斷流程拆解,交給 AI 協助轉化成工具 這次我著手撰寫兩套工具軟體,目標就是把這整個人工流程自動化:偵測 → 掃描 → 瑕疵標記 → 分割建議 → 產出報告。 開發過程主要使用 OpenCode 推進實作。遇到架構卡關的問題,再轉給 Claude 協助審視,提出建議後交回 OpenCode 修正——這樣的協作分工,讓不同 AI... » read more

antiX 26 × fcitx5 × 新酷音:從懷疑人生到徹底搞懂
antiX 26 × fcitx5 × 新酷音:從懷疑人生到徹底搞懂

工程師思路系列 事出必有因 現場實錄 一個 Ctrl+Space,卡了一整晚 antiX 26 × fcitx5 × 新酷音:從懷疑人生到徹底搞懂 我有一台 Acer Aspire 4745G,第一代 i5,4GB RAM,說老不老,說新不新。 它的任務是跟我跑現場——去客戶公司做網路勘查,掃設備、抓封包、出報告。 為了讓這台老筆電跑得動勘查工具,我裝了 antiX 26——一個極度輕量的 Linux 發行版。 裝完之後一切都好,只剩一件事:打不了中文。 「這有什麼難的?」——我當時這樣想 在 Windows 上裝中文輸入法是五分鐘的事。Linux 嘛,查一下文件,跑幾行指令,應該也差不多吧。 結果我低估了這件事。 先裝 fcitx5,按照網路教學一步一步來,裝完重開機——Ctrl+Space,沒反應。 換 fcitx4,一樣。換 ibus,還是一樣。 三套輸入法框架,全部裝了又刪,刪了又裝,環境變數在系統裡留下一堆殘骸互相打架。 讓 Google Search AI 幫我試了四種不同版本,全都失敗。 「是不是 antiX 根本就不支援中文輸入?」 「還是我哪個步驟做錯了?」 「還是這台機器有什麼特殊問題?」 這種時候最消耗心力——不是累,是不知道問題出在哪裡,所以不知道從哪裡修。 換個工具,換個思路 後來我換了方法:不再自己亂試,而是讓 Claude Fable 5 協助我做系統性的診斷。 做法很直接——先寫一支診斷腳本,把系統狀態全部挖出來: 目前裝了哪些輸入法套件、環境變數是什麼值、Display... » read more

一次 CDN 與防火牆互動造成誤判的排查案例
一次 CDN 與防火牆互動造成誤判的排查案例

CPU 很閒,卻幾乎連不上? 一次 CDN 與防火牆互動造成誤判的排查案例 / Mr. τ・風雲網通系統 工程師最怕的,不一定是 CPU 100%。 有時候,CPU 很閒、RAM 很閒、SSD 很閒,但外面就是幾乎連不上。 這種情況,通常代表真正的問題,根本不在主機裡面。 🗓 事情是這樣開始的 這次的案例,並不是監控報警發現的。 是因為我自己要去官網新增一篇部落格文章,打開編輯器之後,發現反應比平常異常地慢——才開始往下查。 這種情況其實很常見。很多問題不是被監控抓到的,而是「剛好要用」的時候才現形。 🔄 推翻假設的過程 第一直覺當然是先看主機硬體資源——CPU、RAM、磁碟,全部正常。 接著看外網流量,也沒有異狀。 切換到防火牆日誌,才看到大量 SYN Flood 告警。 第一反應:被攻擊了?來源 IP 一看——幾乎清一色是 Cloudflare 的全球節點。 原本以為是來自任意來源的攻擊,查詢後才發現,大多是來自 Cloudflare 全球各地的節點。 那問題真的是 Cloudflare 造成的嗎? 不是。 💡 根本原因 根本原因不是 Cloudflare 出問題,而是它改變了流量型態,而防火牆不知道。 Cloudflare 的代理機制,會把大量真實用戶的連線,集中由少數 Edge IP 節點轉送進來。如果防火牆的 SYN Flood 偵測門檻,沒有配合 CDN... » read more

一個 CMOS 斷電事件,如何引爆 BIOS 預設值、舊顯卡驅動、Linux 相容性的三重連鎖崩潰
一個 CMOS 斷電事件,如何引爆 BIOS 預設值、舊顯卡驅動、Linux 相容性的三重連鎖崩潰

工程師思路系列・事出必有因 那顆 16 年沒換的小電池, 讓一台筆電同時得了三種病 一個 CMOS 斷電事件,如何引爆 BIOS 預設值、舊顯卡驅動、Linux 相容性的三重連鎖崩潰 硬體診斷 Linux 老舊設備維護 BIOS 一台「前陣子還好好的」筆電,今天開機全壞了 前陣子才剛在一台 2010 年出廠的 Acer Aspire 4745G 上裝好 antiX Linux,視窗介面正常、自動登入正常,一切運作順暢。 今天把它拿出來,按下電源鍵,螢幕——沒有畫面。 接上外接螢幕之後,終於看到了一個文字終端機介面,靜靜地等著輸入帳號密碼。問題來了:帳密早就忘光了。 好不容易進入救援模式改了密碼,回到系統輸入 startx——失敗。 📋 本次故障症狀清單 ✔內建螢幕無畫面(外接螢幕正常) ✔開機停在文字模式 TTY,要求輸入帳號密碼 ✔原本的圖形介面自動登入功能消失 ✔手動執行 startx 失敗,無法進入視窗環境 四個症狀,看起來像四個問題。但工程師的直覺告訴我:一定有一個共同的根源。 第一直覺:「電池沒電,老電腦嘛,正常的」 這台 i5-460M 的機器距今快 16 年了,電池早就蓄不了電,是人之常情。 但仔細想一想:鋰電池耗盡,頂多就是筆電不能離開變壓器使用。它不會讓作業系統崩潰,不會讓螢幕沒畫面,更不會讓 X Window 開不起來。 所以,真正的問題不在那顆大電池。 真兇,是另一顆沒人記得的小電池。 主角登場:那顆 16 年從沒被換過的 CMOS... » read more