PTT電腦板PC_Shopping最近出現一篇讓A卡玩家看了心有戚戚焉的心得文,一名網友花大錢買了AMD Radeon AI PRO R9700顯示卡,就是衝著能在家跑Qwen 3.8 27B這款開源大型語言模型而來,沒想到一開機才發現事情大條,效能表現慘不忍睹,逼得他只好找上AI幫忙救援,一路熬夜到最後才總算榨出還算能看的成績,貼文一出立刻掀起討論,網友反應正負兩極。

[心得] R9700 + Qwen 3.8 27B 專用 llama 分享

AMD R9700跑Qwen 3.8 27B卡到崩潰?網友找AI互救的來龍去脈

原PO一開始信心滿滿買下R9700,鎖定的正是Qwen 3.8 27B這款由通義千問團隊開源的多模態稠密模型,主打27B參數規模、原生支援26萬token超長上下文,理論上很適合拿來做本地端AI推論。結果實際跑起來卻是「一地雞毛」,用官方ROCm API的速度居然還輸給通用的Vulkan API,讓他直呼莫名其妙。不死心的他先自己土法煉鋼,摸出一個prefill變快、但decode變慢的版本,套用官方llama.cpp ROCm build加上開發者stew675釋出的rdna補丁(github.com/stew675/llama-cpp-rdna-boosts),沒想到碰上長上下文情境,總耗時竟然還贏不了LM Studio內建的Vulkan版本,讓他一度崩潰。走投無路之下,原PO把整包資料丟給Claude Opus 5.5,異想天開提議做一隻「縫合怪」,prefill跑ROCm、decode跑Vulkan混著用。Opus 5.5聽完評估後認為這招太邪門,勸他別這樣搞,改口答應直接幫忙修復ROCm版本本身。經過一整夜的折騰,最終在Windows上以Q5權重、Q8 KV快取、26萬上下文、開啟MTP的設定下,跑出850t/s的prefill速度,decode也有約35t/s,Linux平台同樣適用。原PO大方把最佳化成果整理成教學釋出(github.com/overdoingism/rdna4-fa-band-wmma),還特別建議有需要的人直接讓AI代理程式去讀說明文件最快上手。

貼文曝光後,PTT鄉民留言呈現明顯的正反兩派。挺A卡陣營不吝給讚,直呼「讚讚讚」、「感謝分享」,也有人指出R9700憑著32GB大容量記憶體,算是目前想跑本地端AI裡相對便宜的入門選擇,甚至有人笑稱靠這波折騰乾脆「已下一顆5800x3d ddr4再戰十年」。不過潑冷水的聲音也不少,有網友直接嗆聲「聽GG一句,買顯示卡請買Nvidia,請買Nvid」,還有人搬出規格數據吐槽,指出R9700的記憶體頻寬本來就偏慢,換算下來5090的頻寬是R9700的3倍,但售價也要貴上3倍以上,「這張這麼貴,只有32G當賣點」的說法也引來不少共鳴。也有玩家從模型本身開刀,點出「qwen3.8的問題就是用語太支了」,質疑其中文語感偏向對岸用語。另外還有人跳出來比較各家方案,酸說「買mac更盤,結果還有人出書鼓吹」,也有人反駁Mac其實靠著超大統一記憶體,在本地端AI這塊自成一格。整體看下來,這篇心得文精準戳中A卡玩家想玩本地AI的兩難,一邊是CP值誘人的大視訊記憶體,一邊是軟體生態遠不如N卡穩定的現實。

目前原PO釋出的最佳化教學已經整合完成並且泛化,適用範圍更廣,作者也建議直接讓AI代理程式去讀取說明文件會更好上手,Windows與Linux兩種系統都能套用。從一開始效能慘不忍睹,到最後靠著Claude Opus 5.5熬夜救援衝出850t/s的prefill與約35t/s的decode,這場顯示卡自救記在PTT留言區持續發酵,力挺本地端AI高CP值方案的網友,跟堅持「有錢就衝N卡」的老話派仍在版上互相交鋒。

延伸閱讀

FAQ

R9700擁有32GB大容量記憶體,是目前想跑本地端AI相對便宜的入門選擇。但記憶體頻寬較慢,官方ROCm API支援不如預期。經過最佳化後可跑出850t/s prefill與35t/s decode速度,適合預算有限但需要大容量VRAM的玩家。

原始狀態下效能慘不忍睹,官方ROCm API速度甚至輸給通用Vulkan API。經過Claude Opus 5.5協助最佳化,在Q5權重、Q8 KV快取、26萬上下文、開啟MTP設定下,最終衝出850t/s prefill速度,decode約35t/s,Windows與Linux都適用。

5090記憶體頻寬是R9700的3倍,但售價貴3倍以上。R9700勝在32GB大容量記憶體成本較低,適合預算考量的玩家。不過Nvidia軟體生態穩定性遠優於AMD,ROCm支援仍有優化空間,這是A卡玩家的兩難之處。

本站圖片部分取自於網路,如有版權使用疑慮煩請告知。

標籤關聯文章 : #Claude Opus 5.5
左右滑動查看更多 →