幫助中心 | 我的帳號 | 關於我們

開源大模型全鏈路訓練實踐(預訓練后訓練與數據工程)

  • 作者:周佺喜|責編:袁金敏
  • 出版社:清華大學
  • ISBN:9787302726258
  • 出版日期:2026/10/01
  • 裝幀:平裝
  • 頁數:242
人民幣:RMB 69.8 元      售價:元
放入購物車
加入收藏夾

內容大鋼
    本書是一部系統闡述大模型訓練技術的專業書籍,聚焦DeepSeek、Qwen、GLM、Kimi K2等國產主流開源模型,深入剖析其架構創新與工程實踐。
    全書共12章。第1章解析國內開源模型的技術架構,涵蓋MoE稀疏激活、多頭潛在注意力等前沿設計;第2章介紹訓練理論的數學基礎;第3、4章聚焦數據工程,包括數據採集、清洗、去重、過濾、質量評估、合成數據生成及課程學習策略;第5、6章詳述預訓練工程,涉及分散式架構設計、內存優化、訓練監控與穩定性保障;第7?9章全面覆蓋后訓練技術,從監督微調、強化學習優化到對齊訓練與安全機制;第10?12章探討工程化實踐,包括基礎設施建設、模型壓縮部署及持續學習迭代。
    本書採用演算法偽代碼、數學公式、插圖與表格等形式呈現技術要點,注重方法論的可遷移性。本書適合從事大模型研發的演算法工程師、研究人員、技術架構師閱讀,也可作為人工智慧相關專業本科高年級學生和研究生的學習參考。

作者介紹
周佺喜|責編:袁金敏
    周佺喜,美國約翰斯·霍普金斯大學人工智慧碩士、英國華威大學工程碩士、大模型演算法專家、阿里雲人工智慧高級認證工程師、IBM量子計算認證工程師。專註于企業級AI應用架構的研究,尤其在大語言模型產業化落地、分散式RAG系統開發、智能內容生成等方向有著深厚的技術積累和實戰經驗。現任國家能源集團大模型智能平台首席架構師,主導央企數字化轉型戰略,統籌集團級傳統IT基礎設施向AI智能平台的技術升級。在大模型應用領域取得了一系列開創性成果:主導設計的企業級RAG問答系統在政府知識庫場景成功落地;領導開發智能PPT生成平台;設計實現的多模態對話系統已成功應用於多個大型企業的智能客服場景;主持開發的知識圖譜增強型問答平台創新性地將企業級問答準確率大幅提升。曾任科大訊飛AI演算法架構師,負責企業級AI應用的核心演算法研發和系統架構設計。在任期間成功推動多個行業標桿項目落地,構建了完整的企業A|應用開發規範體系。

目錄
第1章  國內開源大模型技術體系概論
  1.1  國內大模型發展格局與技術路線
    1.1.1  主流開源模型架構對比分析
    1.1.2  技術創新點與差異化策略
    1.1.3  開源生態與社區建設現狀
  1.2  DeepSeek系列模型技術解析
    1.2.1  MoE架構設計與稀疏激活機制
    1.2.2  多頭潛在注意力(MLA)創新
    1.2.3  DeepSeek-R1推理模型與強化學習訓練
  1.3  Qwen系列模型技術解析
    1.3.1  模型規模譜系與MoE架構演進
    1.3.2  多模態統一與多模態融合
    1.3.3  混合思考模式與Agent能力
  1.4  GLM系列模型技術解析
    1.4.1  GLM架構特點與MoE設計
    1.4.2  智能體原子能力與推理模型
    1.4.3  開源策略與生態布局
  1.5  Kimi K2模型技術解析
    1.5.1  萬億參數MoE架構設計
    1.5.2  MuonClip優化器與訓練穩定性
    1.5.3  技術路線對比與選型建議
  1.6  本章小結
第2章  訓練理論的數學基礎
  2.1  優化理論與損失函數設計
    2.1.1  梯度下降演算法族的數學原理
    2.1.2  自適應優化器的收斂性分析
    2.1.3  損失函數的設計原則與權衡
  2.2  分散式訓練的理論基礎
    2.2.1  數據並行與模型並行的數學模型
    2.2.2  梯度同步與通信優化理論
    2.2.3  流水線並行的效率分析
  2.3  縮放定律與計算效率
    2.3.1  Scaling Law的數學推導
    2.3.2  計算最優與數據最優的平衡點
    2.3.3  模型規模與性能的冪律關係
  2.4  注意力機制的數學本質
    2.4.1  自注意力的資訊理論解釋
    2.4.2  位置編碼的頻域分析
    2.4.3  注意力優化的複雜度分析
  2.5  本章小結
第3章  訓練數據的採集與清洗
  3.1  數據源評估與採集策略
    3.1.1  開源數據集的質量評估框架
    3.1.2  網路爬取的法律邊界與技術實現
    3.1.3  專有數據的獲取與處理流程
  3.2  數據清洗Pipeline設計
    3.2.1  文本規範化與編碼統一
    3.2.2  雜訊識別與過濾演算法
    3.2.3  敏感信息檢測與脫敏處理
  3.3  去重技術與實現策略

    3.3.1  MinHash演算法原理與優化
    3.3.2  語義去重的向量化方法
    3.3.3  大規模去重的分散式實現
  3.4  數據質量評估體系
    3.4.1  語言質量的自動化評分
    3.4.2  知識覆蓋度的量化指標
    3.4.3  毒性與偏見的檢測方法
  3.5  本章小結
第4章  數據增強與合成技術
  4.1  基於規則的數據增強
    4.1.1  回譯與paraphrase生成
    4.1.2  模板化數據的批量生成
    4.1.3  知識圖譜驅動的數據擴充
  4.2  基於模型的數據合成
    4.2.1  Self-Instruct方法與實踐
    4.2.2  Constitutional AI數據生成
    4.2.3  迭代優化的數據質量提升
  4.3  合成數據的質量控制
    4.3.1  多樣性與覆蓋度評估
    4.3.2  合成數據的驗證策略
    4.3.3  人工與自動評估的結合
  4.4  數據配比與課程學習
    4.4.1  領域數據的最優混合比例
    4.4.2  課程學習的排序策略
    4.4.3  動態數據選擇演算法
  4.5  本章小結
第5章  預訓練架構設計與實現
  5.1  訓練框架選型與適配
    5.1.1  主流訓練框架對比分析
    5.1.2  國產模型的框架適配要點
    5.1.3  自定義運算元的開髮指南
  5.2  分散式訓練架構設計
    5.2.1  3D/4D並行策略的選擇與組合
    5.2.2  通信拓撲的優化設計
    5.2.3  容錯機制與檢查點管理
  5.3  內存優化與計算加速
    5.3.1  激活重計算的策略選擇
    5.3.2  混合精度訓練的穩定性保障
    5.3.3  Flash Attention與MLA的工程實現
  5.4  超參數調優策略
    5.4.1  學習率調度的設計原則
    5.4.2  批次大小與梯度累積策略
    5.4.3  正則化參數的經驗設置
  5.5  本章小結
第6章  預訓練過程監控與調試
  6.1  訓練指標體系設計
    6.1.1  損失曲線的異常模式識別
    6.1.2  梯度統計與權重分佈監控
    6.1.3  驗證集性能的在線評估
  6.2  訓練穩定性保障

    6.2.1  梯度爆炸與消失的診斷
    6.2.2  數值穩定性的保障措施
    6.2.3  MoE負載均衡與穩定性
    6.2.4  訓練發散的恢復策略
  6.3  性能瓶頸分析與優化
    6.3.1  計算與通信的性能剖析
    6.3.2  數據載入的Pipeline優化
    6.3.3  GPU利用率的提升方法
  6.4  實驗管理與版本控制
    6.4.1  實驗配置的標準化管理
    6.4.2  模型版本與數據版本追蹤
    6.4.3  實驗結果的自動化分析
  6.5  本章小結
第7章  監督微調與指令調優
  7.1  指令數據的構建方法
    7.1.1  任務分類與指令模板設計
    7.1.2  多輪對話數據的組織形式
    7.1.3  Chain-of-Thought數據構造
  7.2  SFT訓練策略優化
    7.2.1  數據採樣與重要性加權
    7.2.2  多任務學習的平衡策略
    7.2.3  災難性遺忘的緩解方法
  7.3  參數高效微調技術
    7.3.1  LoRA及其變體的原理分析
    7.3.2  MoE模型的參數高效微調
    7.3.3  混合微調策略的設計
  7.4  微調效果評估方法
    7.4.1  任務特定指標的設計
    7.4.2  泛化能力的測試策略
    7.4.3  人工評估的組織實施
  7.5  本章小結
第8章  強化學習與偏好優化
  8.1  RLHF技術體系詳解
    8.1.1  獎勵模型的訓練策略
    8.1.2  PPO演算法的實現要點
    8.1.3  KL散度約束的作用機制
  8.2  直接偏好優化方法
    8.2.1  DPO演算法原理與推導
    8.2.2  IPO、CPO與GRPO的改進思路
    8.2.3  在線與離線方法的對比
  8.3  RLAIF與自動化反饋
    8.3.1  AI反饋的可靠性分析
    8.3.2  Constitutional AI訓練流程
    8.3.3  迭代改進的反饋機制
  8.4  推理模型與過程獎勵
    8.4.1  過程獎勵模型(PRM)的設計
    8.4.2  步驟級監督的實現方法
    8.4.3  推理路徑的質量評估
  8.5  本章小結
第9章  對齊技術與安全訓練

  9.1  價值對齊的技術框架
    9.1.1  有用性、誠實性、無害性平衡
    9.1.2  紅隊測試與對抗訓練
    9.1.3  Constitutional方法與自我改進
    9.1.4  安全邊界的定義與實施
  9.2  偏見緩解與公平性
    9.2.1  偏見的檢測與量化方法
    9.2.2  去偏技術的演算法實現
    9.2.3  公平性指標的設計原則
  9.3  魯棒性與對抗防禦
    9.3.1  對抗樣本的生成與檢測
    9.3.2  魯棒訓練的策略選擇
    9.3.3  防禦機制的有效性評估
  9.4  可解釋性與透明度
    9.4.1  注意力可視化技術
    9.4.2  特徵歸因方法的應用
    9.4.3  決策過程的追蹤機制
  9.5  本章小結
第10章  訓練基礎設施建設
  10.1  計算集群架構設計
    10.1.1  網路拓撲與帶寬規劃
    10.1.2  存儲系統的性能優化
    10.1.3  調度系統的選型配置
  10.2  訓練平台工程化
    10.2.1  容器化與環境管理
    10.2.2  自動化訓練Pipeline
    10.2.3  監控告警體系建設
  10.3  成本優化策略
    10.3.1  算力資源的動態分配
    10.3.2  Spot實例的使用策略
    10.3.3  訓練效率的量化分析
  10.4  團隊協作與知識管理
    10.4.1  實驗協作流程設計
    10.4.2  知識庫的構建和維護
    10.4.3  最佳實踐的沉澱機制
  10.5  本章小結
第11章  模型壓縮與部署優化
  11.1  量化技術實踐
    11.1.1  訓練后量化的方法選擇
    11.1.2  量化感知訓練的實施
    11.1.3  混合精度量化策略
  11.2  知識蒸餾技術
    11.2.1  教師模型的選擇策略
    11.2.2  蒸餾損失的設計優化
    11.2.3  多教師蒸餾的實現
  11.3  模型剪枝與稀疏化
    11.3.1  結構化剪枝的演算法設計
    11.3.2  非結構化剪枝的實現
    11.3.3  動態稀疏訓練方法
  11.4  推理加速技術

    11.4.1  KV Cache優化策略
    11.4.2  MoE模型的推理優化
    11.4.3  批處理與併發優化
    11.4.4  硬體加速的適配方法
  11.5  本章小結
第12章  持續學習與模型迭代
  12.1  增量學習策略
    12.1.1  新數據的融合方法
    12.1.2  知識保留機制設計
    12.1.3  性能退化的檢測預防
  12.2  模型版本管理
    12.2.1  版本發布流程規範
    12.2.2  A/B測試的實施方案
    12.2.3  回滾機制的設計實現
  12.3  在線學習與實時更新
    12.3.1  流式數據的處理策略
    12.3.2  在線RLHF的工程實現
    12.3.3  實時性能監控體系
  12.4  長期維護與演進規劃
    12.4.1  技術債務的管理策略
    12.4.2  架構演進的規劃方法
    12.4.3  生態系統的持續建設
  12.5  本章小結

  • 商品搜索:
  • | 高級搜索
首頁│ 新手上路│ 客服中心│ 關於我們│ 聯絡我們│ Top↑│
Copyrightc 1999~2008 美商天龍國際圖書股份有限公司 臺灣分公司. All rights reserved.
營業地址:臺北市中正區重慶南路一段103號1F 105號1F-2F
讀者服務部電話:02-2381-2033 02-2381-1863 時間:週一-週五 10:00-17:00
 服務信箱:bookuu@69book.com 客戶、意見信箱:cs@69book.com
ICP證:浙B2-20060032