與您分享最新動態與資訊
【優游ub8登錄官網科技消息】8月7日消息,AMD于周四收盤后宣布收購AI芯片初創公司Taalas,以強化其在AI推理領域的競爭力。Taalas的核心技術是將模型權重直接蝕刻到硅片中,而非依賴傳統的高帶寬內存存儲,這一方案有望將推理性能提升一個數量級甚至更多。
AMD
Taalas成立于2023年,總部位于多倫多,其技術路線與常規GPU以及Groq LPU、Cerebras晶圓級加速器等數據流架構截然不同。該公司芯片不依賴HBM來存儲模型權重,而是將其直接蝕刻進硅片,形成所謂的模型專用集成電路。芯片主要由兩個區域組成:一是用于存儲模型權重的掩膜ROM召回結構,二是用于存放KV緩存和微調適配器的SRAM召回結構。
今年2月,Taalas發布了其首款測試芯片HC1,采用臺積電6納米工藝制造。初步基準測試顯示,該芯片運行Meta的Llama 3.1 8B模型時速度達到每秒16960個token,這一成績在當時是英偉達GPU的48倍、Cerebras加速器的8.5倍。盡管Llama 3.1以當前標準來看已不算最新模型,但這款光罩尺寸的芯片主要目的在于驗證技術概念的可行性。
Taalas計劃在今年夏季推出第二代HC2芯片,目標將單芯片支持的參數量提升至200億。雖然這一數字聽起來不算龐大,但通過與GPU類似的流水線并行方式,權重可以分布在多個加速器上運行。以單芯片200億參數計算,僅需50顆加速器即可支持萬億參數級別的大模型,而AMD恰好擁有機架級計算平臺和內部系統設計團隊來滿足這一需求。相比之下,英偉達近期發布的LPX系統運行同等規模模型需要數十顆GPU和至少2000顆Groq LPU,Taalas方案在空間占用和功耗效率方面優勢明顯。
據知情人士透露,AMD計劃將基于Taalas技術的芯片與其Instinct系列的Helios機架配對使用,形成一種分離式架構:計算密集型的提示詞處理由GPU負責,而token生成任務則卸載到Taalas加速器上。另一種可能的部署模式是,客戶先在Instinct加速器上部署和驗證模型,待確認效果滿意后再遷移至Taalas加速器,形成類似tick-tock的迭代節奏。
AMD人工智能高級副總裁Vamsi Boppana在聲明中表示,AMD正在構建全棧式AI平臺,為客戶提供靈活性,使其能夠為每一項AI工作負載部署最合適的計算解決方案。
不過,這項技術也存在明顯的局限性。由于模型權重被固化在硅片中,一旦芯片部署完成便無法更換模型,任何超出LoRA適配器規模的改動都需要重新流片,不僅成本高昂而且周期較長。在AI模型幾乎每月都有新版本推出的當下,這意味著采用Taalas技術的客戶必須對模型選擇有充分把握。Taalas方面則表示,雖然新模型確實需要重新流片,但無需從頭開始,只需更改兩層金屬層即可,成本和周期都大幅降低。
從應用場景來看,這項技術主要面向AI模型開發商、基礎設施提供商和部分推理服務商。Taalas此前曾表示,將模型權重蝕刻進硅片的成本比訓練前沿模型低100倍。AMD目前與OpenAI、Anthropic和Meta等主要模型廠商均保持著密切合作關系,未來看到GPT或Claude系列模型部署在Taalas與Instinct混合架構上并不令人意外。
此外,該技術對模型開發方式也可能產生深遠影響。開發者近年來通過測試時縮放技術來降低模型幻覺,即允許模型在回答前進行更長時間的推理,但代價是消耗更多token、成本上升且用戶等待時間延長。如果Taalas技術能夠將單token成本大幅降低并將輸出速度提升10倍甚至20倍,模型開發商可能會進一步延長推理時間以換取更高的準確性。
此次交易預計將在第四季度完成,尚待監管部門批準。AMD未披露具體交易條款,但據悉這是一次完整的收購而不僅僅是人才收購。這筆交易被視為AMD挑戰英偉達在AI硬件領域主導地位的最新舉措,與英偉達去年12月與Groq達成的200億美元授權協議形成對標,目標都是讓高性能推理服務在AI智能體等應用場景中運行得更快、更便宜。
版權所有,未經許可不得轉載
優游ub8登錄官網Copyright ? 2019-2025 成都優游UB8微電子科技股份有限公司 版權所有 備案編號: 蜀ICP備2022009451號 川公網安備 51019002004893號