跳到正文

#教學/實務

RSS
今日 9 則
9月12日週六
  1. GitHub Blog · AI & ML62

    Marketing ops as code:在 GitHub 上將活動從規劃到跟進全流程自動化

    GitHub 營銷負責人分享瞭如何利用 GitHub Copilot、GitHub Actions 及 API/CLI 工具將亞太區的活動運營流程實現程式碼化與自動化。通過將執行手冊轉化為 Markdown 技能並結合 Issue 觸發器,系統能夠自動生成落地頁、分發 UTM 連結、每日篩查註冊名單以及在活動後執行跟進。

    推薦理由:作者通過自身實踐展示瞭如何用自然語言和平臺原生功能自動化營銷運營,為非技術背景人員提供了可複用的工作流改造方法。

9月11日週五
  1. openrouter blog62

    OpenRouter 語音生成 API 教學與實作指南

    OpenRouter 正式推出相容 OpenAI 的語音生成 (text-to-speech) API 端點,讓開發者透過單一 API 金鑰與統一的請求結構,就能存取多個提供者的 TTS 模型。

    推薦理由:原文詳解透過 OpenAI 相容端點呼叫多個提供者語音模型的完整流程,工程師可直接參考程式碼實作串接與錯誤驗證。

9月10日週四
  1. Hugging Face Blog73

    基於 Hugging Face Jobs 與儲存桶跨節點非同步訓練 LoRA

    Hugging Face 官方介紹瞭如何使用 TRL v1.14 中的 AsyncGRPOTrainer 在不同機器上非同步訓練 LoRA 介面卡並同步至 vLLM。通過將兆位元組大小的 rank-1 介面卡寫入儲存桶並藉助代理路由 KV 快取字首,該方案省去了 NCCL 跨節點通訊,使 500 步訓練耗時縮短至原來的四分之一。

    推薦理由:文章展示瞭如何在不同機器上執行訓練與推理,通過儲存桶同步 LoRA 介面卡,為分散式強化學習提供了可複用的工程方案。

9月9日週三
  1. Mistral AI65

    Mistral AI 用 AI 代理完成 Fortran 77 遷移至 C++

    Mistral AI 幫助一家歐洲能源運營商將 40,000 行 Fortran 77 程式碼遷移至 C++,通過 AI 代理完成語法轉換、架構重構和測試。文章詳細闡述了構建數值一致性驗證 harness、文件化流程、以及人機協同的結構化工作流,並給出遷移經驗。

    推薦理由:案例展示瞭如何用 AI 代理完成 Fortran 77 到 C++ 的遷移,並給出可複製的工作流程與經驗。

  2. openrouter blog68

    Seedance 2.5 評測:最佳應用與使用時機

    Seedance 2.5 是 ByteDance 的影片生成模型,支援 4–30 秒長度、480p/720p、六種長寬比,並可接受影像、影片、音訊參考。

    推薦理由:本文詳細說明 Seedance 2.5 的定價、長度、參考輸入與比較,幫助使用者選擇合適模型,並可快速評估成本與效能差異。

9月3日週四
  1. Hugging Face Blog66

    如何用 TRL 和 OpenEnv 訓練程式碼模型繪製水彩畫

    作者基於開源方案復現了讓大語言模型通過編寫 JavaScript 程式碼繪製水彩畫的強化學習流程,並公開了參考影像池、強化學習環境、訓練指令碼及訓練好的模型。文章對比了不同美學獎勵權重配置下的多項實驗結果,詳細記錄了基礎設施搭建及訓練調優過程中的發現。

    推薦理由:文章復現並開源了使用強化學習訓練程式碼模型繪製水彩畫的完整流程,為讀者提供了基於美學偏好進行對齊的具體實現與多重實驗對比。

  2. Hugging Face Blog62

    如何微調 350M 模型以在 100 個 GRPO 步驟中實現更好的結構化輸出

    本文介紹了使用 TRL 庫和 GRPO 對 LFM2.5-350M 模型進行輕量化微調的開源教程,展示了僅需約 500 個樣本和 100 個訓練步驟即可將模型在 IFStruct 基準測試中的整體表現從 22.6% 提升至 29.7% 的具體方法。

    推薦理由:文章提供了在免費 GPU 環境下用 GRPO 最佳化小模型結構化輸出的完整開源配方,讀者可以藉此評估低成本對齊對模型輸出合規性的實際提升效果。

8月26日週三
  1. Hugging Face Blog77

    使用 Sentence Transformers 訓練和微調多向量嵌入模型

    Sentence Transformers v6.0 版本引入了多向量檢索模型和完整的訓練方法。作者以醫療檢索領域為例,展示瞭如何在一塊消費級 GPU 上微調出一個超越各大通用檢索模型的領域專用模型。微調方法涵蓋了模型選擇、資料集格式、損失函式、訓練引數以及評估器等核心元件。

    推薦理由:文章給出了多向量嵌入模型的完整訓練與微調步驟,讀者可以據此在特定領域獲得超越通用檢索模型的效果。

8月25日週二
  1. openrouter blog74

    如何在編輯器中即時挑選最佳 AI 模型

    核心框架:先定義任務,從即時使用率與第三方基準篩選候選,最後在自己的 prompt 上測試。 成本衡量:以「每完成一個任務的成本」為單位,而非每 token 價格,並考慮重試與延遲。 工具支援:OpenRouter MCP 伺服器可在任何編輯器中連線,提供即時排名、價格、延遲與測試介面。

    推薦理由:文章提供了以成本、延遲和任務為核心的模型挑選流程,幫助工程師快速評估並落地實際工作。

  2. openrouter blog67

    OpenRouter 影片生成 API:程式碼優先指引

    OpenRouter 透過統一的非同步影片生成 API,讓開發者一次提交、輪詢、下載即可支援 Seedance、Veo、Wan 等多款模型。 - 工作流程:POST /api/v1/videos 提交工作 → 監控 job‑status → 下載 MP4。

    推薦理由:統一的非同步 API 讓多模型影片生成變簡單,利於快速測試與成本掌控。

8月17日週一
  1. openrouter blog67

    OpenRouter Image Generation: A Code-First API Tutorial 圖片生成 API 教學

    OpenRouter Image Generation API 推出統一的端點與金鑰機制,讓開發者透過單一請求格式呼叫多款圖片生成模型。 - 核心端點:透過 POST /api/v1/images 傳送請求,並在 data[0].b64_json 接收 Base64 編碼的圖片資料。

    推薦理由:原文提供使用統一介面呼叫多模型圖片生成與參考圖應用的完整程式碼,讀者可據此快速整合 API 至現有專案。

8月14日週五
  1. openrouter blog75

    如何透過 API 將圖片傳送給大語言模型:視覺指南

    本文介紹如何在聊天請求中透過 content 陣列傳送文字與圖片,支援多種視覺模型且請求格式保持一致。 - 請求格式:使用 messages 陣列,包含 type: text 與 type: image_url 兩個部分,支援公開網址與 base64 資料格式。

    推薦理由:原文詳細拆解如何透過 API 傳送圖片給多模態大語言模型,開發者可據此評估公開網址與 base64 編碼的適用時機。

  2. Hugging Face Blog65

    使用 Strands Agents、LeRobot 與 Hugging Face Storage Buckets 實現錄製、訓練與部署一體化

    本文介紹了 Strands Robots 中的流式資料閉環方案,展示瞭如何通過自然語言指令錄製機器人示範資料、將其同步至 Hugging Face Storage Buckets 並進行基於 Xet 的位元組級去重。隨後,開發者可以直接從 Hub 流式讀取資料集來訓練策略,並將訓練好的檢查點重新部署到硬體上。

    推薦理由:文章介紹了基於 Strands Agents 和 LeRobot 的機器人流式資料閉環方案,讀者可以據此瞭解如何通過雲端儲存桶實現無本地下載的高效訓練。

8月12日週三
  1. openrouter blog69

    跨模型工具呼叫:一次編寫迴圈,隨意切換模型

    跨模型工具呼叫:一次編寫迴圈,隨意切換模型 - 工具定義:使用 OpenAI 相容的 JSON schema 定義 get_weather(location, unit),同一套工具可在所有模型上重用。

    推薦理由:本指南示範單一程式碼即可在 OpenAI、Claude 與 Llama 等多個模型上執行工具呼叫,降低切換成本,並提供完整的迴圈流程與錯誤處理建議。

8月6日週四
  1. openrouter blog66

    如何在 OpenRouter 上控管團隊的 AI 支出

    OpenRouter 官方文章介紹了 6 種用於控管團隊 AI 花費的控制機制,並針對不同團隊規模與風險需求提供實用的配置建議。 - 六大控制機制:包含金鑰額度限制、防護欄、工作區預算、預設配置、組織與角色許可權,以及活動儀錶板。

    推薦理由:文章詳細梳理了 OpenRouter 提供的各項花費控制功能與適用場景,幫助團隊按需求選擇最合適的預算管理策略。

7月28日週二
  1. openrouter blog68

    如何跨延遲、吞吐量與正常執行時間評估大模型服務商效能

    OpenRouter 官方發布指南,深入解析如何跨延遲、吞吐量、正常執行時間與量化精度評估不同大模型服務商的效能表現。 - 四大核心指標:延遲(首字延遲 TTFT)、吞吐量(每秒輸出 token 數)、正常執行時間與量化精度,並建議使用 p90 與 p99 尾部延遲而非平均值來衡量真實體驗。

    推薦理由:原文分析不同服務商的效能與量化差異並給出路由策略,讀者可據此評估如何量化評估與最佳化大模型服務商表現。

7月21日週二
7月16日週四
  1. Hugging Face Blog31

    Newer Models, Same Advantage:DharmaOCR 如何憑領域專注度擊敗更新的模型

    儘管架構更新,但憑藉領域專注度和針對性訓練,DharmaOCR 在巴西葡萄牙語處理上依然表現優於 Mistral OCR4 和 Unlimited-OCR。在葡萄牙語專屬評估基準中,DharmaOCR 取得了 0.925 的分數,而 Mistral OCR4 為 0.798,Unlimited-OCR 為 0.7587。這種效能優勢源於其引數資源完全集中於單一語言領域,而非分散在多語言空間中。

7月13日週一
7月10日週五
7月6日週一
  1. Hugging Face Blog47

    PRX 第 4 部分:資料策略

    PRX 團隊公開了 7B 模型的預訓練資料策略,詳細闡述了結合公共與內部資料集、利用 VLM 重新加長文本標註以及通過 Mosaic Streaming(MDS)和 Lance 格式進行分散式訓練的完整資料流水線。該團隊放棄了預計算文本潛變數,轉而在訓練迴圈中動態執行 Qwen3-VL 文本編碼器,僅帶來約 3-4% 的吞吐量成本。

1月22日週四
  1. Mistral AI66

    Mistral AI:排查 vLLM 中的記憶體洩漏

    Mistral AI 團隊詳細復盤了在 vLLM 分離部署測試中發現並解決隱蔽記憶體洩漏的完整過程。通過結合 pmap、BPFtrace 與 GDB 自動化指令碼,團隊最終定位到根源在於 UCX 記憶體管理模組的 mmap 鉤子機制與註冊快取佇列。通過設定環境變數 UCX_MEM_MMAP_HOOK_MODE=none 或限制未釋放區域數量,成功解決了該記憶體洩漏問題。

    推薦理由:文章詳細記錄了排查 vllm 分離部署中隱蔽記憶體洩漏的過程,讀者可以學習如何通過 pmap 與 GDB 組合定位底層系統呼叫問題。

8月1日週五
4月9日週三