#教學/實務
RSS 訂閱#教學/實務
RSSAndrej Karpathy (@karpathy)@karpathyAI 評分2828 Latent SpaceAI 評分3434 學術是為野心而設 — Alex Zhang, MIT
summary_zh: Alex Zhang, MIT, 在 AI Engineer NYC 直播中闡述 Recursive Language Models (RLMs) 與 GPU kernels 的創新應用。
openrouter blog精選AI 評分7070 支援機器人模型路由:低成本 FAQ 處理
支援機器人模型路由 介紹低成本 FAQ 處理方式,說明三種路由模式與 OpenRouter 的實作流程。
推薦理由:本文說明如何透過成本最佳化的模型路由,幫助支援機器人降低開銷並提升回覆品質,同時提供實際測試指標與實作範例。
openrouter blogAI 評分5454 代理框架比較:工具呼叫模式處理
本文比較六大代理框架在工具呼叫模式處理上的差異,並說明如何在 OpenRouter 的 API 層統一工具呼叫格式,讓模型切換只需改模型字串。 - 工具呼叫差異:OpenAI、Anthropic、Google 各自使用不同的工具定義與回傳格式,直接寫一套工具定義在另一個平臺會失敗。
openrouter blog精選AI 評分6969 LangChain 與 CrewAI:與 OpenRouter 原生路由的協調比較
本文說明 LangChain 與 CrewAI 在多模型協調方面的差異,並示範如何將 OpenRouter 原生路由與這兩個框架結合。 - 三層架構:工作流協調、模型路由、供應商路由。
推薦理由:文章說明多模型協調的三層架構,並示範如何將 OpenRouter 與 LangChain 或 CrewAI 結合,對構建可擴充的 LLM 工作流十分實用。
AWS Machine Learning Blog精選AI 評分7676 Amazon Bedrock AgentCore:利用 Agentic AI 擴大雲遷移
Amazon Bedrock AgentCore 透過 Agentic AI 與 MCP 工具,將 300+ 應用的 IaC 開發時間從數週縮至分鐘,並保證安全合規。
推薦理由:本文示範利用 Bedrock AgentCore 及 MCP 工具,將 300+ 應用 IaC 開發時間從數週縮至分鐘,並保證安全合規,易於直接應用於自家雲遷移。
AWS Machine Learning Blog精選AI 評分6565 使用 NVIDIA NeMo Agent Toolkit 與 Amazon S3 Vectors 建構代理記憶
NVIDIA NeMo Agent Toolkit 在 Amazon S3 Vectors 作為持久記憶後端的實作教學。 - S3 Vectors:向量相似度搜索、可擴充套件至 2B 向量、強寫一致、按 IAM 控制存取。
推薦理由:本文示範如何將 Amazon S3 Vectors 作為 NVIDIA NeMo Agent Toolkit 的記憶後端,並在 EKS 上部署,提供擴充套件 記憶解決方案。
AWS Machine Learning Blog精選AI 評分6060 在 AWS 上為 Claude Platform 實作多環境存取
本指南示範如何在 AWS 上為 Claude Platform 建立多環境存取與工作區隔離,為跨雲與開發者提供安全、可擴充且易於維護的部署方案,並詳述 IAM、API 金鑰與 OIDC 的實作細節。
推薦理由:本指南示範如何在 AWS 上為 Claude Platform 建立多環境存取與工作區隔離,為跨雲與開發者提供安全、可擴充且易於維護的部署方案,並詳述 IAM、API 金鑰與 OIDC 的實作細節。
AWS Machine Learning Blog精選AI 評分7575 使用 Amazon Bedrock AgentCore 建置 Ambient Agent:從事件驅動訊號到人機互動工作流程
本文詳細說明如何使用 Amazon Bedrock AgentCore 與 LangChain 建置具備人機互動的 Ambient Agent,並示範從 S3 事件觸發到工作流程執行的完整流程。
推薦理由:此文章提供了完整的端到端實現細節,幫助工程師快速搭建具備人機互動的 ambient agent,並示範如何結合 Bedrock 與 LangChain。
AWS Machine Learning Blog精選AI 評分7272 利用 AWS 上的情境多臂賽局提升獲客漏斗轉換率
本文說明如何在 AWS 上使用情境多臂賽局,提升獲客漏斗轉換率,並提供完整程式碼與架構示例。 - 核心成效:在七週 A/B 測試中,部分客群最終漏斗轉換率提升高單位數字,另一客群無提升。
推薦理由:本文說明如何在 AWS 上運用情境多臂賽局提升轉換率,並提供完整程式碼與架構示例,適合想落實個性化推廣的工程師。
AWS Machine Learning Blog精選AI 評分7171 uniopen 如何將 Amazon Nova 2 Lite 定製為其零售審核政策的生產部署
導語:uniopen 透過 LoRA 微調與提示最佳化,將 Amazon Nova 2 Lite 定製為符合其零售審核政策的模型,並在生產環境中落地。
推薦理由:本案例說明如何透過 LoRA 微調與提示最佳化,使 Amazon Nova 2 Lite 達到零售審核的目標指標,並展示完整的訓練、評估與部署工作流程,為類似場景提供可複製的參考,並說明硬門檻與軟門檻的設計思路。
openrouter blogAI 評分5353 模型升級路由的信心閾值設定
本文說明如何利用模型自報的信心值來動態路由請求,平衡成本與準確度。 - 信心分數:模型以 0~1 的數值回傳,供程式判斷。 - 設定閾值:以自身流量測試錯誤率,選取錯誤率急升的分數作為閾值。
openrouter blog精選AI 評分7272 代理模型成本與品質折衷框架
代理模型成本與品質折衷框架 介紹一套三步驟流程,協助使用者根據任務品質門檻與實際成本,挑選最具成本效益的模型。 - 品質門檻設定:先決定任務對準確度的最低需求,低於門檻即使便宜亦不合格。
推薦理由:此框架幫助工程師用實際成本與質量分數挑選最具成本效益的代理模型,避免因排行榜高分而付高價,並可隨時重新評估模型與價格變動。
openrouter blog精選AI 評分6767 在 CI 中用 LLM 評估門檻阻止 PR 合併
這篇指南說明如何在 CI 流程中使用固定 LLM 評估集,將合併門檻設為評分閾值,防止錯誤代理程式被合併。 - 評估集:將測試案例以 JSON 形式提交至 repo,僅透過審核 PR 變更。
推薦理由:此指南示範如何在 CI 中用固定 eval 集阻止錯誤代理合併,並說明成本與閾值設定。
AWS Machine Learning Blog精選AI 評分6262 在 Amazon Bedrock AgentCore Runtime Instances 上構建多智慧體音樂製作管線
AWS 介紹瞭如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一個三智慧體協作的音樂製作管線,實現 GPU 音樂生成、音訊處理與合規篩查。文章詳細講解了容量提供者配置、共享會話的多智慧體同機協作、多日持久化儲存以及各智慧體的獨立部署流程。
推薦理由:文章給出了基於 Amazon Bedrock AgentCore Runtime Instances 部署多智慧體音樂製作管線的具體步驟與架構設計,讀者可以據此瞭解長週期持久化與多智慧體協同的實現方式。
AWS Machine Learning Blog精選AI 評分6161 如何使用 Amazon Bedrock Knowledge Bases 以自然語言查詢理賠資料
本文介紹瞭如何使用 Amazon Bedrock Knowledge Bases 構建具備自然語言查詢、後設資料過濾、對話記憶和上下文安全護欄的理賠助手。文章詳細給出了將 S3 中的理賠文件與後設資料同步至託管知識庫、呼叫 AgenticRetrieveStream API 處理多步問題、渲染引用以及配置防護欄的具體實現步驟與程式碼示例。
推薦理由:文章提供了構建帶有引用和後設資料過濾的智慧檢索助手的完整程式碼與架構,讀者可以據此在實際工作流中實現可追溯的文件查詢。
AWS Machine Learning BlogAI 評分3131 Amazon Textract 介面卡生命週期管理跨賬戶自動化
Amazon Textract 通過將介面卡 ID 外部化到 AWS Systems Manager Parameter Store,實現跨賬戶推廣與零停機更新。文中提供 CloudFormation 與 Terraform 模板、預分類路由流程以及網路隔離、IAM 最小許可權等安全措施,幫助企業在受監管環境下快速落地。
AWS Machine Learning BlogAI 評分5454 使用 Amazon Nova Act 實現合成監控
本文介紹瞭如何使用 Amazon Nova Act 和 Amazon Bedrock AgentCore 實現基於智慧體的合成監控,通過自然語言動作替代脆弱的 DOM 選擇器來驗證關鍵使用者流程。文章闡述了架構設計、部署流程以及如何結合 Amazon EventBridge Scheduler 與 Amazon SNS 進行告警。
AWS Machine Learning BlogAI 評分4747 如何在 SageMaker AI 上使用 vLLM-Omni 生成影像和影片(第二部分)
本文介紹瞭如何在 Amazon SageMaker AI 上使用 vLLM-Omni Deep Learning Container 部署 FLUX.2-klein-4B 即時影像生成端點與 Wan2.1-VACE-1.3B 非同步影片生成端點。工作流通過傳送文本提示詞生成靜態影像,隨後將其作為條件輸入並結合運動提示詞傳輸至影片端點,最終從 Amazon S3 獲取生成的 MP4 影片。
AWS Machine Learning BlogAI 評分5959 在 SageMaker AI 上使用 vLLM-Omni 構建即時語音應用
本文介紹瞭如何在 Amazon SageMaker AI 上使用 AWS vLLM-Omni 深度學習容器部署 Qwen3-TTS 模型,並通過雙向 WebSocket 連線實現文本輸入與流式語音輸出。文章給出了完整的程式碼示例、例項池配置方法以及 Gradio 客戶端的部署與測試步驟。
openrouter blog精選AI 評分8181 提示詞或模型變更後的 AI Agent 迴歸測試指南
OpenRouter 發布指南介紹如何在提示詞、模型、工具定義或檢索設定變更後對 AI Agent 進行迴歸測試,確保行為符合預期合約。 - 核心方法:鎖定測試案例集,採用結構化斷言(如檢查工具呼叫與引數)而非傳統文本比對。
推薦理由:文章詳細說明如何對 AI Agent 進行迴歸測試,幫助開發者在更換模型或修改提示詞時確保行為穩定。
openrouter blog精選AI 評分6565 如何利用生產流量建立黃金評估資料集並評測多個模型
本文介紹如何使用真實的生產流量建立黃金評估資料集(Golden Eval Dataset),用以取代無法反映產品實際流量的公開基準測試。 - 五步驟建構流程:包含抽取生產流量、清理重複與分群、加入期望輸出與評分規準、執行首次評估修正規準、版本控管並整合至 CI。
推薦理由:本文介紹如何以真實生產流量建立黃金評估資料集,讀者可據此評估如何將其整合至現有工作流程。
openrouter blog精選AI 評分7474 如何在 AI 智慧體中測試工具呼叫準確率
本文介紹了評估 AI 智慧體工具呼叫準確率的三種核心方法,並提供透過 OpenRouter 跨模型進行測試的實作範例。 - 三大測試方法:包含無參考答案的 LLM 評審、確定性引數檢查(使用 JSON Schema)、以及軌跡比較。
推薦理由:文章提供評估工具呼叫準確率的三種方法與程式碼範例,工程師可據此建立跨模型評測套件。
AWS Machine Learning BlogAI 評分2424 Amazon Quick 的提示詞工程基礎指南
Amazon Quick 平臺的提示詞工程通過明確具體性、提供業務背景以及採用示例教學等核心原則,幫助使用者獲得更高質量的 AI 響應結果。該方法通過減少反覆除錯並實現複雜工作流程的自動化,從而提升團隊在各種 AI 功能上的協作效率。文章作為系列的第一部分,詳細介紹了適用於所有 Quick 元件的通用原理與結構化框架。
AWS Machine Learning BlogAI 評分5454 Amazon Quick 元件化提示詞工程:模式與避坑指南
本文介紹了 Amazon Quick 各核心元件的提示詞編寫模式與常見誤區。針對 Quick Research、Quick Flows、Quick Sight 及 chat agents 等模組,文章給出了明確目標設定、邏輯拆解、引數規範與身份定義等具體實踐方法。
AWS Machine Learning BlogAI 評分4242 如何用 Amazon Quick 和 Amazon Bedrock AgentCore 構建 AI 驅動的合同智慧平臺
AWS 介紹了一種結合 AI 智慧體、多模型驗證與嵌入式分析的合同智慧平臺架構,可解決傳統 RAG 無法處理的大規模合同跨文件聚合查詢難題。該平臺利用 Amazon S3 儲存合同 PDF,通過 Claude Sonnet 提取欄位、Claude Haiku 驗證結果,並以 Amazon Aurora PostgreSQL 儲存結構化資料,實現秒級處理與精準問答。
AWS Machine Learning Blog精選AI 評分6363 Condé Nast 如何利用 Amazon Bedrock 建立多模態影片檢索
Condé Nast 透過 Amazon Bedrock 與 OpenSearch Service 建構多模態影片檢索系統,將平均搜尋時間從 250 分鐘縮短至 2 分鐘。
推薦理由:案例展示如何利用 Bedrock 與 OpenSearch 構建高效影片檢索,顯著降低檢索時長,具備可複製性,為媒體行業提供可落地的多模態檢索方案,節省人力成本並提升內容變現速度
openrouter blog精選AI 評分6262 OpenRouter 評比多款圖生影片模型:成本、解析度與控制
OpenRouter 發布多款主流圖生影片模型的效能與成本對比,涵蓋 Veo 3.1、Seedance、Kling 及 Grok Imagine Video 系列。
推薦理由:原文對比多款熱門圖生影片模型的規格與成本,工程師可據此評估適合特定專案的模型選項。
OpenAI NewsAI 評分3939 邁向前沿 AI 訓練的安全案例
OpenAI 釋出的早期前沿 AI 訓練安全案例指南,涵蓋技術防護、運營實踐以及對模型對齊偏差事件的調查。該指南旨在為前沿 AI 系統的安全訓練提供系統性框架。
Simon WillisonAI 評分6666 Simon Willison 分享使用 Claude Opus 5.5 與 Claude Code 製作 Kākāpō Party 動畫與影片的流程
Simon Willison 在 WeAreDevelopers 閉幕演講中,利用 Claude Opus 5.5 結合照片生成了 HTML5 畫素風鸚鵡派對動畫,並通過 Claude Code 配合 Playwright 自動點選錄製了演示影片。文章分享了完整的提示詞、生成過程以及 Playwright 自動化指令碼。
GitHub Blog · AI & ML精選AI 評分6262 GitHub Copilot 如何使用 canvases 構建自定義工作流
GitHub Copilot app 推出了 canvases 功能,允許使用者通過 /create-canvas 技能與自然語言描述,免編碼生成支援雙向互動的自定義工作流介面。畫布可作為共享白板即時更新,支援團隊共享或儲存為個人擴充套件,使用者也可直接安裝 Awesome Copilot 中的現成擴充套件進行定製。
推薦理由:文章介紹了 GitHub Copilot app 中使用 canvases 自定義工作流的方法,讀者可以學習如何通過描述直接生成雙向互動介面。
AWS Machine Learning Blog精選AI 評分7979 Amazon EKS 與 EFA、DeepEP 結合實現 MoE RL 訓練吞吐提升 40%
本文介紹瞭如何利用 Amazon EKS、EFA 與 DeepEP 在大規模 MoE RL 訓練中實現 40% 以上吞吐提升。
推薦理由:本文詳細闡述瞭如何利用 Amazon EKS、EFA 與 DeepEP 在大規模 MoE RL 訓練中實現 40% 以上吞吐提升,幫助讀者快速搭建高效、成本友好的分散式 RL 基礎設施。
AWS Machine Learning BlogAI 評分4646 如何在 Amazon SageMaker HyperPod 上使用 SkyRL 加速多模態強化學習訓練
本文介紹瞭如何在 Amazon SageMaker HyperPod 上使用開源強化學習框架 SkyRL,配合 GRPO 演算法對 Qwen3-VL-8B 視覺語言模型進行多模態強化學習後訓練。
AWS Machine Learning Blog精選AI 評分6565 AWS 詳解基於 Amazon Bedrock 構建生產級大語言模型質量保障體系
AWS 團隊詳細介紹了面向生產環境的大語言模型質量保障架構,通過自適應管道編排、跨賬戶多模型故障轉移、即時流式評估、複合評估框架以及資料準確性驗證五項技術,在 Amazon Bedrock 上實現了約 99% 的數值準確率並支援即時流式響應。文章重點闡述瞭如何通過三階段自適應處理、獨立配額空間網格、生產者消費者併發模式及兩階段級聯驗證來解決模型幻覺、API 限流和驗證延遲等工程挑戰。
推薦理由:文章詳細拆解了五項用於保障大語言模型生產環境質量的技術實現,幫助開發者在實際業務中平衡準確率與響應延遲。
AWS Machine Learning BlogAI 評分4949 如何在 Amazon SageMaker AI 上部署 Qwen3-TTS 實現即時個性化語音克隆
阿里雲千問團隊開發的 Qwen3-TTS-12Hz-1.7B-Base 語音模型現已上線 Amazon SageMaker JumpStart,支援通過託管的即時推理端點實現語音克隆與流式生成。該模型僅需數秒的使用者音訊片段與文本,即可在保持說話人聲音特徵的同時跨語言合成目標語音,並允許使用者在 AWS 環境中控制成本與資料安全。
AWS Machine Learning Blog精選AI 評分7070 Amazon SageMaker HyperPod 與 Qumulo 實現多區域訓練
本文介紹瞭如何使用 Amazon SageMaker HyperPod 與 Qumulo 的 Cloud Native 解決方案,在不同 AWS 區域間進行大規模 AI 模型訓練,並給出了跨區域訓練的效能驗證結果。
推薦理由:文章詳細說明如何使用 SageMaker HyperPod 與 Qumulo 進行跨區域訓練,並給出驗證結果,幫助讀者評估跨區域訓練的效能與成本。
AWS Machine Learning Blog精選AI 評分6767 WhisperX 在 SageMaker AI 上實現說話人標註轉寫
本文介紹了 AWS WhisperX Deep Learning Container(DLC)的使用方法,演示如何在 Amazon SageMaker AI 上部署即時和非同步端點,實現詞級時間戳和說話人標籤的轉寫。
推薦理由:本文展示瞭如何在 SageMaker 上部署 WhisperX,實現精準的詞級時間戳和說話人標籤,幫助使用者快速構建可搜尋、可稽核的音訊轉寫系統。
Simon WillisonAI 評分5353 Shadow roots, explained with live examples
通過互動示例介紹了 Shadow DOM 的工作原理,展示了樣式封裝、繼承、slots、parts 以及 JavaScript 訪問方式,探討了 Shadow roots 如何建立帶有私有樣式表的隔離 DOM 樹。
openrouter blog精選AI 評分6161 如何使用 Jev:在 TypeScript 中透過 Jev API 進行內容審核
本文介紹如何使用 TypeSafe 開發的決策模型 Jev,透過 TypeScript 與 OpenRouter Decisions API 建立完整的商品審核流程。
推薦理由:文章透過市集商品審核的完整端到端範例,展示如何使用 Jev 決策模型與 TypeScript 搭配 OpenRouter API 進行結構化判斷。
openrouter blog精選AI 評分7777 Jev 與 LLM 搭配指南:何時使用決策模型而非生成文本
本文探討如何結合 TypeSafe 的決策模型 Jev 1.13 與大型語言模型建構客服自動化管線,透過分流與驗證機制兼顧成本與準確率。 - 效能與成本:在支援票證分類測試中,Jev 1.13 的成本僅為 $0.0248 每千筆,延遲約 194 ms,準確率與 GPT Luna 相當。