幫助中心 | 我的帳號 | 關於我們

深入淺出強化學習演算法與實戰

  • 作者:編者:朱萬林|責編:耍利娜
  • 出版社:化學工業
  • ISBN:9787122509543
  • 出版日期:2026/09/01
  • 裝幀:平裝
  • 頁數:319
人民幣:RMB 99 元      售價:
放入購物車
加入收藏夾

內容大鋼
    本書循序漸進、深入系統地講解了強化學習的核心原理、主流演算法與工程實踐,內容豐富、層次清晰、通俗易懂。全書共12章,涵蓋從基礎知識、經典演算法,到深度強化學習、策略優化方法,再到離線強化學習、模型強化學習、多任務與多智能體系統等前沿內容。書中不僅詳細介紹了Q-learning、DQN、PPO、TRPO、GRPO等演算法的原理與推導,還配套了多個完整實戰案例,如Atari遊戲、CartPole平衡控制、迷宮導航系統、機械臂抓取、多智能體博弈等,幫助讀者快速掌握從演算法理解到項目落地的全流程技能。本書語言簡潔直觀,圖文結合,配有大量實戰項目和訓練結果分析,同時覆蓋了市面上同類圖書較少涉及的內容,如強化學習在大模型中的新應用(GRPO)、元強化學習的系統構建,以及工業級多智能體訓練框架,極具實用性與前瞻性,是學習強化學習開發技術與實戰應用的理想工具。
    本書適合具有Python基礎、了解機器學習或深度學習初步知識的讀者閱讀,尤其適合人工智慧開發者、AI工程師、機器人研究人員、自動化系統設計者,也可作為高校人工智慧相關專業的教材或教學參考書,以及企業培訓課程的技術參考資料。

作者介紹
編者:朱萬林|責編:耍利娜

目錄
第1章  強化學習基礎與核心概念
  1.1  強化學習基礎知識
    1.1.1  強化學習的誕生背景
    1.1.2  強化學習的核心思想與要素
    1.1.3  強化學習與其他機器學習方法的區別
    1.1.4  強化學習的挑戰
  1.2  強化學習的應用領域概覽
    1.2.1  機器人控制與路徑規劃
    1.2.2  遊戲與虛擬環境
    1.2.3  金融與投資決策
    1.2.4  自動駕駛與智能交通
    1.2.5  自然語言處理中的應用
  1.3  強化學習的理論基礎:馬爾可夫決策過程
    1.3.1  MDP的概念和定義
    1.3.2  策略、值函數(V, Q)和貝爾曼方程
  1.4  OpenAI Gym環境初探
    1.4.1  OpenAI Gym簡介
    1.4.2  MountainCar環境
    1.4.3  CartPole環境
第2章  強化學習的經典求解方法
  2.1  動態規劃:策略迭代與值迭代
    2.1.1  策略迭代
    2.1.2  值迭代
  2.2  蒙特卡洛方法:從經驗中學習
    2.2.1  蒙特卡洛預測
    2.2.2  蒙特卡洛控制
    2.2.3  探索策略
  2.3  時序差分學習
    2.3.1  TD(0)預測和SARSA
    2.3.2  Q-learning:離策略學習的代表
    2.3.3  綜合實戰:使用Q-learning解決網格世界問題
第3章  深度Q網路:從遊戲突破到通用值函數逼近
  3.1  Q-learning的局限與深度化的必要性
    3.1.1  數據相關性問題:Q-learning面臨的挑戰
    3.1.2  目標值的不穩定性:傳統方法的缺陷
    3.1.3  高維狀態空間的困難:對深度化的需求
  3.2  DQN的核心思想與突破
    3.2.1  經驗回放:打破數據相關性
    3.2.2  目標網路:穩定學習目標
  3.3  DQN演算法流程與實現細節
    3.3.1  DQN的神經網路結構
    3.3.2  訓練循環:從環境交互到參數更新
    3.3.3  目標網路的更新過程:權重同步時機與方法
    3.3.4  超參數的選擇與調整:學習率、折扣因子等的影響
  3.4  綜合實戰:用DQN玩轉Atari遊戲
    3.4.1  Atari遊戲環境介紹
    3.4.2  具體實現
第4章  DQN演算法的演進
  4.1  Double DQN
    4.1.1  DQN演算法的問題剖析

    4.1.2  Double DQN的核心思想
    4.1.3  Double DQN的演算法流程與實現要點
    4.1.4  綜合實戰:使用Double DQN實現超級馬里奧遊戲
  4.2  Dueling DQN
    4.2.1  Dueling DQN的動機
    4.2.2  Dueling DQN網路架構設計
    4.2.3  綜合實戰:使用Dueling DQN實現二維網格世界導航任務
  4.3  優先順序經驗回放
    4.3.1  優先順序經驗回放的動機
    4.3.2  優先順序定義與採樣策略
    4.3.3  重要性採樣校正
    4.3.4  綜合實戰:比較DQN中普通經驗回放和PER在CartPole問題中的表現
第5章  策略梯度方法:直接優化策略
  5.1  策略梯度定理:理論基礎
    5.1.1  策略梯度的定義與意義
    5.1.2  與值函數方法的對比分析
    5.1.3  策略梯度定理的適用場景與局限性
  5.2  REINFORCE:蒙特卡洛策略梯度演算法
    5.2.1  演算法原理與實現
    5.2.2  基線的引入與作用
  5.3  綜合實戰:CartPole平衡控制與LunarLander軟著陸
    5.3.1  背景介紹
    5.3.2  實驗環境與任務建模
    5.3.3  具體實現
    5.3.4  運行結果與分析
第6章  Actor-Critic演算法:融合價值與策略
  6.1  Actor-Critic原理
    6.1.1  策略梯度與值函數結合的動機
    6.1.2  Actor與Critic的角色分工
    6.1.3  策略評估與策略改進的閉環
    6.1.4  經典AC演算法流程
    6.1.5  綜合實戰:使用經典AC演算法解決CartPole-v1平衡問題
  6.2  A2C演算法
    6.2.1  優勢函數的數學原理
    6.2.2  蒙特卡洛與TD誤差的優勢函數估計
    6.2.3  GAE技術
    6.2.4  綜合實戰:A2C演算法實現與優勢估計方法比較
  6.3  A3C演算法
    6.3.1  並行化架構設計
    6.3.2  非同步梯度更新與鎖機制
    6.3.3  探索策略:熵正則化在A3C中的應用
    6.3.4  綜合實戰:A2C和A3C的性能對比
  6.4  SAC演算法
    6.4.1  熵正則化與探索激勵
    6.4.2  SAC演算法核心設計
    6.4.3  綜合實戰:基於SAC演算法的機械臂抓取任務
第7章  TRPO演算法核心知識與應用實踐
  7.1  TRPO基礎知識
    7.1.1  TRPO演算法的誕生背景
    7.1.2  TRPO演算法的意義

  7.2  TRPO演算法的核心原理
    7.2.1  信任域概念的引入
    7.2.2  構建目標函數與約束條件
    7.2.3  綜合實戰:使用TRPO解決CartPole平衡問題
  7.3  綜合實戰:基於低秩矩陣的TRPO優化
    7.3.1  優化策略:NN-TRPO和TRLRPO
    7.3.2  項目介紹
    7.3.3  經驗數據管理和狀態空間離散化
    7.3.4  定義環境
    7.3.5  創建強化學習模型
    7.3.6  創建代理
    7.3.7  評估TRPO在CustomAcrobotEnv環境中的性能
    7.3.8  評估TRPO在Mountain-CarContinuous-v0環境中的性能
    7.3.9  評估TRPO在Custom-PendulumEnv環境中的性能
    7.3.10  性能可視化
第8章  OpenAI的PPO和DeepSeek的GRPO
  8.1  PPO演算法的核心知識和應用
    8.1.1  PPO的推出背景
    8.1.2  PPO演算法的基本思想
    8.1.3  綜合實戰:使用PPO演算法解決CartPole平衡問題
  8.2  GRPO演算法的核心知識和應用
    8.2.1  GRPO的誕生背景
    8.2.2  GRPO演算法的基本原理
    8.2.3  GRPO演算法的數學推導
    8.2.4  GRPO在DeepSeek-R1模型中的作用和表現
    8.2.5  庫TRL
    8.2.6  綜合實戰:使用GRPO演算法訓練數學問題解答模型
第9章  離線強化學習:從歷史數據中學習策略
  9.1  離線RL的核心挑戰
    9.1.1  分佈偏移
    9.1.2  外推誤差
    9.1.3  數據質量依賴性
  9.2  約束策略優化
    9.2.1  常用的約束策略優化方法介紹
    9.2.2  綜合實戰:比較三種約束策略優化方法的性能
  9.3  基於不確定性的方法
    9.3.1  常用的基於不確定性的方法介紹
    9.3.2  綜合實戰:比較三種基於不確定性的方法的性能
  9.4  模仿正則化
    9.4.1  常用的模仿正則化方法介紹
    9.4.2  綜合實戰:評估AWAC、IQL和ORL方法的性能
第10章  前沿技術:基於模型的強化學習
  10.1  基於模型和無模型的強化學習介紹
    10.1.1  核心區別
    10.1.2  基於模型的強化學習方法的優勢
    10.1.3  無模型的強化學習方法的優勢
    10.1.4  基於模型和無模型的強化學習方法的結合策略
    10.1.5  綜合實戰:迷宮環境中的障礙物檢測與獎勵分配
  10.2  學習環境動力學模型
    10.2.1  模型表示形式:確定性模型與隨機模型

    10.2.2  模型學習的損失函數
    10.2.3  常用模型學習技術
    10.2.4  處理部分可觀測性
    10.2.5  綜合實戰:基於模型的CartPole動力學學習與規劃
  10.3  利用模型進行規劃
    10.3.1  規劃的基本概念:開環規劃與閉環規劃
    10.3.2  經典規劃方法
    10.3.3  採樣式規劃方法:蒙特卡洛樹搜索
    10.3.4  採樣式規劃方法:模型預測控制
    10.3.5  軌跡採樣與策略改進
    10.3.6  綜合實戰:用採樣規劃方法解決一個網格世界問題
  10.4  集成規劃與學習:前沿技術介紹
    10.4.1  學習規劃器:端到端訓練
    10.4.2  MuZero:統一學習、規劃與表示的典範
    10.4.3  其他前沿方法簡述
第11章  多任務與元強化學習
  11.1  多任務學習:共享知識解決多個任務
  11.2  元強化學習:快速適應新任務
  11.3  綜合實戰:基於元強化學習的迷宮導航系統
第12章  多智能體強化學習實戰:火星殖民地遊戲
  12.1  項目背景介紹
  12.2  功能介紹
  12.3  運行環境
  12.4  智能體核心邏輯

  • 商品搜索:
  • | 高級搜索
首頁新手上路客服中心關於我們聯絡我們Top↑
Copyrightc 1999~2008 美商天龍國際圖書股份有限公司 臺灣分公司. All rights reserved.
營業地址:臺北市中正區重慶南路一段103號1F 105號1F-2F
讀者服務部電話:02-2381-2033 02-2381-1863 時間:週一-週五 10:00-17:00
 服務信箱:bookuu@69book.com 客戶、意見信箱:cs@69book.com
ICP證:浙B2-20060032