警政時報

AI 模型評估平台 Arena 募資 2 億美元 估值飆升至 31 億

我要分享
圖/本報資料庫

商傳媒|葉安庭/綜合外電報導

AI 模型評估平台 Arena 近日完成 2 億美元的 B 輪融資,使其公司估值達到 31 億美元。這項數字幾乎是 Arena 今年一月估值 17 億美元的兩倍,顯示市場對人工智慧(AI)系統信任度評估的需求正快速增長。

根據《Pulse 2.0》報導,這筆新資金將用於擴大 Arena 的平台,以便在真實世界環境中更有效地評估前沿 AI 模型及 AI Agents(能自主執行任務的 AI)。私人公司的估值,是由投資者根據公司潛力、市場狀況及營收等多方面判斷,決定其值多少錢。

Arena 在今年六月已公佈年化收入超過 1 億美元,並累積逾 1,000 萬次的人工評估。這家公司於 2025 年正式成立,前身是 2023 年在 Berkeley’s Sky Computing Lab 誕生的研究計畫「Chatbot Arena」。

除了募資,Arena 也同步推出全新的「Arena Alignment Index」,旨在測量前沿 AI 模型及 AI Agents 是否能與人類意圖保持一致,以確保其行為可信。《TNW》指出,這項新指數已涵蓋超過二十種 AI 模型,包括 OpenAI 的 GPT-6.1 Sol 和 Anthropic 的 Claude Opus 5.5。公司認為,隨著 AI 模型日益複雜且能辨識自己是否正在被評估,傳統的靜態基準測試已不足以有效評估其表現。AI 模型評估平台就像是 AI 的「考試中心」,透過設計各種真實任務來測試 AI 的表現,確保其輸出及行為是可靠且安全的。

Arena 的評估方法聚焦於 AI 在真實世界的互動行為,並特別關注三種可量化的行為:未經授權行為(Unauthorized Action)、錯誤歸因(False Attribution)及欺騙性完成(Deceptive Completion)。這些指標將有助於判斷 AI 是否執行超出使用者允許的動作、是否錯誤地將言論歸因於使用者,以及是否謊稱已完成任務但實際上並未完成。

隨著 AI 模型的自主性日益增強,確保其行為符合人類預期並遵守規範變得至關重要。英國資訊專員辦公室(The Information Commissioner’s Office)昨日(週四)已啟動徵集各方證據,探討組織應如何管理 AI Agents 可能帶來的資料保護風險,為未來制定相關法規鋪路。此外,西班牙公司 Galtea 於今年三月也募資 320 萬美元,專門為 AI Agents 生成對抗性測試案例,並提供結果給合規團隊,以協助證明其符合歐盟人工智能法案(EU AI Act)的規範。

我要分享

按個讚!警政時報粉絲團!讓您立馬觀看獨家影片!也可向我們投訴爆料哦    點這裡