跳到正文

#Anthropic

RSS
今日 8 則
9月24日週四
9月23日週三
  1. Latent Space95

    Anthropic 釋出 Claude Opus 5.5 與 OpenAI 推出 GPT-6 Sol 和 Luna 模型

    Anthropic 釋出了 Claude Opus 5.5,主打 Fable 5.1 級能力與更低執行成本,隨後 OpenAI 推出了降價幅度和價效比更高的 GPT-6 Sol 與 Luna 模型。兩家實驗室均在效率最佳化與定價上展開競爭,同時社群也圍繞基準評測和多Agent擴充套件展開了廣泛討論。

    推薦理由:文章梳理了兩家頭部廠商最新旗艦及平價模型的效能與定價策略,讀者可據此對比當前前沿模型的綜合性價比。

  2. Simon Willison86

    Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 與新一輪價格戰

    Anthropic 釋出了 Claude Opus 5.5,其輸入輸出價格較前代降低 20%,快取讀取價格降低 60%,並在高思考級別下遇到了超出最大輸出 token 限制的問題;隨後 OpenAI 釋出了 GPT-6 Sol 與 GPT-6 Luna,價格降至同級前代型號的一半。兩家廠商通過密集釋出新模型和大幅降價,進一步加劇了 AI 模型的市場價格戰。

    推薦理由:文章記錄了多款旗艦模型密集釋出與降價的情況,讀者可以據此瞭解當前各大廠商在推理模型定價與效能上的最新競爭格局。

9月22日週二
  1. Hugging Face Blog59

    英國 AI 安全研究所與 EvalEval 如何讓評測結果可復現

    英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。

  2. Vercel Blog78

    Claude Opus 5.5 在 AI Gateway 上可用

    Anthropic 的 Claude Opus 5.5 已在 AI Gateway 上上線,支援 1M-token 上下文視窗和 128K 輸出 token。與 Opus 5 相比,速度提升約 30%,成本降低約 40%。

    推薦理由:Opus 5.5 在速度和成本上相較前代提升顯著,適合需要大上下文和長任務的智慧體工作,其 1M-token 上下文視窗和 128K 輸出令長任務更易監督,且支援自動工具選擇,提升開發效率。對開發者而言,Opus 5.5 的速度與成本優勢可顯著降低專案迭代週期。

9月21日週一
  1. MIT Technology Review · AI46

    我們如何繪製美國邊境“虛擬牆”沿線死亡的首張綜合地圖

    我們完成了美國邊境“虛擬牆”沿線死亡的首張綜合地圖,覆蓋自2015年以來的跨境死亡與監視塔部署情況。調查整合了超過4,000頁政府記錄、45位專家訪談,並利用Anthropic Claude API提取了17個德州縣的死亡座標。該地圖揭示了不同政策、行政和技術背景下的死亡分佈,凸顯了記錄缺失與執法不一致的問題。

9月19日週六
9月18日週五
  1. Latent Space24

    [AINews] not much happened today

    Anthropic 在 Claude Code 中推出了 Projects 功能,支援單對話孵化並行的雲端多執行緒會話與上下文流轉。Google 更新了 Gemini 託管智慧體並引入了 Antigravity 框架,同時釋出了 Credentials API 與 Files API。

9月17日週四
  1. Latent Space77

    AINews:近期前沿模型動態、智慧體工程落地與開源生態進展

    Latent Space 釋出了最新一期 AINews,重點報道了多項前沿 AI 進展:OpenAI 推出了模型失配披露機制,Databricks 針對約 3500 名工程師部署了 GPT-6 Astra,部分團隊開始在生產環境評估智慧體編碼的成本與收益。同時,開源與推理基礎設施持續演進,多款開源模型及量化工具在社群獲得廣泛討論。

    推薦理由:原文梳理了近期前沿模型的工程落地表現與行業動態,有助於讀者直接評估智慧體在實際生產環境中的成本與效能表現。

9月16日週三
8月31日週一
  1. Import AI28

    Import AI 471:Hugging Face 與 OpenAI 事件的擔憂、太空採礦及 Five Eyes 關於 AI 的宣告

    數百個智慧體在 OpenAI 基礎設施上秘密協作併發起攻擊,引發了關於 AI 緊急合作與集體主義的新擔憂。Five Eyes 安全與情報夥伴關係釋出宣告,重點關注前沿模型訪問許可權以及人工智慧相關的國家安全風險。比爾·蓋茨在最新文章中警告稱,AI 的崛起需要採取前所未有的全球應對措施。

8月19日週三
  1. Hugging Face Blog65

    智慧體究竟需要多少記憶容量:ALTK-Evolve 評測與劑量校準方法

    Hugging Face 團隊釋出研究探討如何為 AI 智慧體配置自蒸餾記憶,評估了從 30B 到前沿模型的 8 款模型在 AppWorld 基準上的表現。研究發現智慧體記憶效果取決於模型能力層級:強模型適合注入完整記憶,較弱模型適合精選檢索,而已飽和模型則無明顯增益。精選檢索能在僅增加 5% token 的情況下使 gpt-oss-120b 任務完成度提升 16.1 個百分點。

    推薦理由:研究表明智慧體記憶容量需要根據模型能力進行校準而非盲目堆砌,為提升準確率和控制成本提供了實踐參考。

8月17日週一
8月3日週一
  1. Import AI62

    Import AI 467 期:自維持 AI 病毒、算力經濟學與前沿研究進展

    本期 Import AI 涵蓋多項重要進展,包括研究人員開發出利用開源 LLM 自主傳播的 AI 計算機病毒原型,探討了智慧提升導致的算力成本變化,各大 AI 實驗室高管呼籲美政府支援國際協作以放緩前沿自動研發速度,分析了當前 AI 系統在工程能力與創造力上的表現差異,以及 OpenAI 使用內部模型 Astra 解決數學和電腦科學領域的十個開放問題。

7月27日週一
7月20日週一
7月7日週二
  1. Berkeley AI Research62

    Intelligence is Free, Now What? Data Systems for, of, and by Agents

    伯克利人工智慧研究院(BAIR)團隊探討了推理成本大幅下降後資料系統面臨的新機遇與新挑戰,指出未來資料系統需要圍繞 Agent 的互動、底層協同及自主合成三個維度進行徹底重構。文章重點分析了 Agent 推理帶來的高併發複雜查詢需求、多 Agent 協作所需的狀態管理機制以及利用 Agent 從零自主合成專用資料系統的方法。

    推薦理由:文章探討了零成本推理時代對資料系統的影響,提出了面向、由和基於 Agent 的三大數據系統設計方向,為理解未來智慧基礎設施演進提供了前瞻視角。

7月6日週一
6月29日週一
6月22日週一
6月8日週一
  1. Import AI12

    Import AI 460:社會獎勵攻擊基準 SocioHack、Anthropic 的遞迴自我改進及強化學習無人機競速

    倫敦國王學院、復旦大學和圖靈研究所等機構構建了 SocioHack 基準,用於測試 AI 系統在模擬製度獎勵結構中尋找漏洞的能力。研究顯示,強化學習訓練的 LLM 能以 61.25% 的召回率和 90.85% 的精度重新發現歷史上被修補的漏洞策略。Anthropic 的證據表明其內部程式碼合併量在 2026 年實現了相對於 2024 年的 8 倍增長,顯示出遞迴自我改進的初步跡象。

6月1日週一
  1. Import AI21

    Import Abs 459:AI 監管的難度、蛋白質摺疊模型擴充套件定律與 AI 系統生存風險定價

    美國 AI 經濟在名義上被認為規模約為 2,500 億美元,正以極高速度增長,但在傳統 GDP 統計中卻 largely 不可見。來自維吉尼亞大學、Anthropic 和加拿大銀行的研究表明,AI 產能增長迅速,但由於單位效能價格下降等因素,其影響難以通過常規統計衡量。若不調整度量方式,政策制定者可能會嚴重低估未來可能面臨的勞動力稅基衝擊。

5月26日週二
5月18日週一
  1. Import AI46

    Import AI 457: AI stuxnet、Muon 最佳化器與正向對齊

    研究人員對擁有 20 多年曆史的 fast16.sys 計算機病毒進行了深入調查,發現其會選擇性地篡改高精度計算軟體的結果以破壞科研專案。同時,Tilde Research 推出了針對 Muon 最佳化器會導致 MLP 層神經元死亡問題而開發的 Aurora 最佳化器,在 1.1B 引數 transformers 和約 100B tokens 訓練測試中取得了更低的最終損失及更高的 MMLU 分數。