跳到正文

#arXiv

RSS
今日 0 則
9月26日週六
  1. Ars Technica · AI53

    AI 衝擊了應屆生就業嗎?最新經濟學研究資料表明並非如此

    慕尼黑 CESifo 經濟學研究人員釋出的一項新工作論文顯示,目前沒有證據表明人工智慧對近期大學畢業生的絕對或相對就業水平造成了顯著、廣泛的替代或招聘減少。此前曾有斯坦福大學研究指出受 AI 影響職業的初級就業滯後,而該研究則聚焦於勞動力需求可能首先通過減少招聘體現的現象,並分析了近期企業增加 AI 支出和任務替代的背景。

9月2日週三
  1. Hugging Face Blog55

    BenchMIRT:大模型基準測試究竟在測量什麼?

    Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。

8月24日週一
  1. Import AI31

    Import Inst 470:機器學習無版權;用 SPADE 自動化環境生成;用 Hawkeye 構建更好的 GPU kernel

    一項研究表明,大模型在網路安全領域帶來了大幅加速,在數學研究中帶來了較小加速,而在 AI 自身研究中尚未帶來可測量的加速。多所高校研究者聯合推出了 SPADE,這是一個通過自我對弈協同演化環境合成與智慧體能力的通用框架。該框架在 30B 規模下利用 Qwen3 骨幹網路進行了測試,在遊戲和工具使用環境評測中均提升了效能。

8月21日週五
  1. Hugging Face Blog64

    Hugging Face 部落格:衡量語音識別中的基準測試最佳化現象

    Hugging Face 最新研究引入了三項測試,用於量化語音識別模型中的基準測試最佳化(benchmaxxing)現象,評估了 11 個開源 ASR 模型後發現部分高分系統會復現基準測試中的錯誤轉錄、填補被靜音的數字並根據資料集調整拼寫習慣。

    推薦理由:研究指出語音識別模型會利用音訊中的線索復現公開測試集的錯誤和拼寫習慣,這有助於理解如何通過獨立測試集評估模型真實效能。

8月13日週四
  1. Hugging Face Blog74

    Hugging Face 部落格:復現 2,200 篇 ICML 論文的經驗與發現

    Hugging Face 舉辦了一場使用編碼智慧體逐條復現 ICML 2026 論文的駭客松,1,221 名參與者在 19 天內釋出了 6,816 份日誌並嘗試復現了 2,226 篇論文。

    推薦理由:文章公佈了大規模智慧體復現學術論文的成果與發現,讀者可以從中瞭解自動化復現對檢驗科研質量的實際效果與侷限。

8月12日週三
  1. Google Research63

    空書架還是丟了鑰匙?研究稱檢索是大語言模型引數化真實性的瓶頸

    Google Research 介紹了知識 profiling 行為框架和 WikiProfile 基準,用以衡量大語言模型的編碼與檢索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事實已被編碼,但模型仍無法直接檢索其中 26% 至 34% 的事實。這說明事實性錯誤主要源於知識無法可靠呼叫的檢索失敗,而非知識未被編碼的儲存缺失。

    推薦理由:研究指出前沿大語言模型的知識編碼已接近飽和,準確率瓶頸在於檢索而非儲存,為後續訓練與推理最佳化提供了新方向。

6月30日週二
6月25日週四
  1. Google Research48

    用線性彈性快取最佳化雲端經濟學

    Google Research 提出了線性彈性快取方法,將頁面驅逐建模為滑雪租賃問題,並利用輕量級機器學習動態調整快取大小。在 Spanner 生產工作負載的測試中,該方法使記憶體使用量減少了 15.5%,快取命中率略有下降,並將總擁有成本(TCO)降低了約 5%。

6月22日週一
4月20日週一
  1. Berkeley AI Research66

    GRASP:提升狀態、加入噪聲與梯度重塑實現長時序規劃

    GRASP 是一種新的梯度規劃器,針對學習到的世界模型實現長時序規劃。它通過將軌跡提升到虛擬狀態實現並行最佳化、在狀態迭代中加入噪聲以增強探索、並重塑梯度以避免脆弱的狀態輸入梯度,從而顯著提升規劃魯棒性和速度。實驗顯示在 Push‑T 任務中,GRASP 在更長時間步上取得更高成功率且耗時更短。詳情見論文 https://arxiv.org/abs/2602.00475。

    推薦理由:GRASP 通過提升狀態、加入噪聲與梯度重塑,解決了大規模世界模型長時序規劃的梯度爆炸與不穩定問題。

4月16日週四
9月1日週一
  1. Berkeley AI Research54

    Word2Vec 究竟學到了什麼?

    伯克利人工智慧研究團隊發表論文,為經典語言建模任務 word2vec 的學習過程提供瞭解析理論。研究證明在實際訓練設定下,該學習問題可簡化為無加權最小二乘矩陣分解,其梯度流動力學可通過閉式求解,學到的最終表徵即為主成分分析結果。