警政時報

太空首例軌道AI模型訓練成功 輝達H100晶片驗證新里程碑

我要分享

商傳媒|何映辰/台北報導

2025年12月10日,美國新創公司Starcloud宣布,他們已在低軌道(環繞地球的軌道,海拔約160公里至2,000公里)成功訓練了一個大型語言模型(LLM),創下太空AI發展的新紀錄。這項突破性成就使用了一枚NVIDIA H100 GPU,此晶片與地球上資料中心用於訓練人工智慧模型的頂級硬體屬於同級產品,目前正在地球上方約500公里處運行。

根據《Scienceblog.com》報導,Starcloud的工程師們在名為Starcloud-1的衛星上,利用這枚NVIDIA H100 GPU,透過莎士比亞作品的數據集訓練了一個NanoGPT模型。訓練完成後,該模型成功生成了莎士比亞風格的新文本,驗證了在太空中進行AI訓練的可行性。不過,Starcloud也強調,這是一次緊湊的NanoGPT展示,而非規模等同於 ChatGPT 的軌道訓練,目的是測試AI軟體堆疊在太空環境中的表現。

將資料中心級的GPU送上太空,面臨著嚴峻的技術挑戰。地球上的NVIDIA H100 GPU通常設置在具備高容量電力分配、液體或空氣冷卻系統、冗餘網路和專業技術人員的伺服器內。但在太空中,太空船必須在真空、輻射和嚴格的質量限制下運行。真空會阻礙對流冷卻,因此廢熱必須從GPU傳導出去,最終以紅外線輻射形式散逸。此外,高能粒子可能導致記憶體損壞或電子元件發生單次事件故障,這些元件最初並非為承受輻射的太空硬體所設計。Starcloud-1這枚重約60公斤的技術驗證衛星,成功將實際的資料中心加速器暴露在這些極端條件下,並運行了考驗計算與記憶體的AI工作負載,證明了AI軟體堆疊能夠從地球伺服器機房過渡到自主太空船。

在衛星上訓練模型意味著模型本身的改變,這需要重複執行前向傳播、損失計算、反向傳播和權重更新等複雜步驟。此次軌道訓練的數據集僅約一兆位元組,與現代大型語言模型訓練所需的兆級 Token(AI模型處理資訊的基本單位)數據量相去甚遠。將龐大訓練數據傳送至軌道是另一項限制,現階段可能需要耗費大量時間、頻寬與能源。然而,此次成功展示了太空AI訓練的潛力,特別是考量到NVIDIA H100晶片在此類運算任務中的核心地位,持續驅動著全球半導體產業的技術進步。

除了Starcloud的軌道AI訓練進展,人工智慧算力需求的激增也促成了科技巨頭在太空領域的佈局。根據《iClarified》報導,美國太空公司SpaceX近期已完成對AI程式編輯器Cursor的收購案,這項交易價值約600億美元。SpaceX表示,此次收購將讓Cursor能夠運用「全球最大規模的GPU艦隊」,以更經濟的方式開發出更強大的AI模型。這筆併購案始於今年4月的合作夥伴關係,旨在加速AI模型訓練,SpaceX指出,收購Cursor將有助於其「建立超出當今水平的運算能力,而Cursor將是這項智慧發揮作用的平台」。這項整合的早期成果,便是本週稍早發布的Grok 4.6模型,顯示太空科技與AI運算能力的結合,正成為推動人工智慧發展的新興趨勢。

我要分享

按個讚!警政時報粉絲團!讓您立馬觀看獨家影片!也可向我們投訴爆料哦    點這裡