PTT電腦板PC_Shopping最近出現一篇讓A卡玩家看了心有戚戚焉的心得文,一名網友花大錢買了AMD Radeon AI PRO R9700顯示卡,就是衝著能在家跑Qwen 3.8 27B這款開源大型語言模型而來,沒想到一開機才發現事情大條,效能表現慘不忍睹,逼得他只好找上AI幫忙救援,一路熬夜到最後才總算榨出還算能看的成績,貼文一出立刻掀起討論,網友反應正負兩極。
![[心得] R9700 + Qwen 3.8 27B 專用 llama 分享](https://admin.juksy.com/files/articles/151976/6ab9314ecb27b.jpg)
- AMD RX 9070XT破解跑DLSS5!2K解析度衝破60幀 網友吐槽角色變老15歲
- Meta 與 AMD 簽下百億美元大單!股價盤前暴衝至 14%!
- 快搶!TUF Gaming《黑色行動7》特別版顯示卡超限量上市
- Computex /MSI Claw A8 掌機登場!螢幕、手感、效能⋯等細節亮點一次看!
- AMD 財報亮眼,資料中心不如預期!專家指出:「有潛力縮小與輝達的差距!」
AMD R9700跑Qwen 3.8 27B卡到崩潰?網友找AI互救的來龍去脈
原PO一開始信心滿滿買下R9700,鎖定的正是Qwen 3.8 27B這款由通義千問團隊開源的多模態稠密模型,主打27B參數規模、原生支援26萬token超長上下文,理論上很適合拿來做本地端AI推論。結果實際跑起來卻是「一地雞毛」,用官方ROCm API的速度居然還輸給通用的Vulkan API,讓他直呼莫名其妙。不死心的他先自己土法煉鋼,摸出一個prefill變快、但decode變慢的版本,套用官方llama.cpp ROCm build加上開發者stew675釋出的rdna補丁(github.com/stew675/llama-cpp-rdna-boosts),沒想到碰上長上下文情境,總耗時竟然還贏不了LM Studio內建的Vulkan版本,讓他一度崩潰。走投無路之下,原PO把整包資料丟給Claude Opus 5.5,異想天開提議做一隻「縫合怪」,prefill跑ROCm、decode跑Vulkan混著用。Opus 5.5聽完評估後認為這招太邪門,勸他別這樣搞,改口答應直接幫忙修復ROCm版本本身。經過一整夜的折騰,最終在Windows上以Q5權重、Q8 KV快取、26萬上下文、開啟MTP的設定下,跑出850t/s的prefill速度,decode也有約35t/s,Linux平台同樣適用。原PO大方把最佳化成果整理成教學釋出(github.com/overdoingism/rdna4-fa-band-wmma),還特別建議有需要的人直接讓AI代理程式去讀說明文件最快上手。
貼文曝光後,PTT鄉民留言呈現明顯的正反兩派。挺A卡陣營不吝給讚,直呼「讚讚讚」、「感謝分享」,也有人指出R9700憑著32GB大容量記憶體,算是目前想跑本地端AI裡相對便宜的入門選擇,甚至有人笑稱靠這波折騰乾脆「已下一顆5800x3d ddr4再戰十年」。不過潑冷水的聲音也不少,有網友直接嗆聲「聽GG一句,買顯示卡請買Nvidia,請買Nvid」,還有人搬出規格數據吐槽,指出R9700的記憶體頻寬本來就偏慢,換算下來5090的頻寬是R9700的3倍,但售價也要貴上3倍以上,「這張這麼貴,只有32G當賣點」的說法也引來不少共鳴。也有玩家從模型本身開刀,點出「qwen3.8的問題就是用語太支了」,質疑其中文語感偏向對岸用語。另外還有人跳出來比較各家方案,酸說「買mac更盤,結果還有人出書鼓吹」,也有人反駁Mac其實靠著超大統一記憶體,在本地端AI這塊自成一格。整體看下來,這篇心得文精準戳中A卡玩家想玩本地AI的兩難,一邊是CP值誘人的大視訊記憶體,一邊是軟體生態遠不如N卡穩定的現實。
目前原PO釋出的最佳化教學已經整合完成並且泛化,適用範圍更廣,作者也建議直接讓AI代理程式去讀取說明文件會更好上手,Windows與Linux兩種系統都能套用。從一開始效能慘不忍睹,到最後靠著Claude Opus 5.5熬夜救援衝出850t/s的prefill與約35t/s的decode,這場顯示卡自救記在PTT留言區持續發酵,力挺本地端AI高CP值方案的網友,跟堅持「有錢就衝N卡」的老話派仍在版上互相交鋒。
延伸閱讀
FAQ
R9700擁有32GB大容量記憶體,是目前想跑本地端AI相對便宜的入門選擇。但記憶體頻寬較慢,官方ROCm API支援不如預期。經過最佳化後可跑出850t/s prefill與35t/s decode速度,適合預算有限但需要大容量VRAM的玩家。
原始狀態下效能慘不忍睹,官方ROCm API速度甚至輸給通用Vulkan API。經過Claude Opus 5.5協助最佳化,在Q5權重、Q8 KV快取、26萬上下文、開啟MTP設定下,最終衝出850t/s prefill速度,decode約35t/s,Windows與Linux都適用。
5090記憶體頻寬是R9700的3倍,但售價貴3倍以上。R9700勝在32GB大容量記憶體成本較低,適合預算考量的玩家。不過Nvidia軟體生態穩定性遠優於AMD,ROCm支援仍有優化空間,這是A卡玩家的兩難之處。
本站圖片部分取自於網路,如有版權使用疑慮煩請告知。
-
美國人工智慧公司Anthropic於美國時間9月22日正式發布Claude Opus 5.5,這是Claude 5.5系列首款推出的模型。官方將新模型定位為「多數工作可達到Claude Fable 5.1水準」,但執行成本卻比前代Opus ...2026-09-23