幫助中心 | 我的帳號 | 關於我們

剖析大語言模型(南京大學人工智慧系列教材)

  • 作者:編者:申富饒|責編:姚蕾//陳佳媛
  • 出版社:機械工業
  • ISBN:9787111813033
  • 出版日期:2026/08/01
  • 裝幀:平裝
  • 頁數:229
人民幣:RMB 89 元      售價:
放入購物車
加入收藏夾

內容大鋼
    本書是大語言模型的入門書籍,共分為7章,內容由淺入深、邏輯清晰。開篇從大語言模型的基本定義、發展脈絡與技術演進講起,細緻拆解Transformer核心架構;隨後依次講解自監督預訓練原理、模型高效微調技術、檢索增強生成(RAG)框架,以及高質量數據體系構建方法;最後梳理當前主流開源大模型,詳解多個實戰項目,為讀者搭建起清晰的大語言模型學習路徑。
    本書力求理論與實踐結合,每章都配有練習,並在章節間穿插了「稍事休息」環節,介紹相關的技術趣聞與背景故事。全書使用Python作為主要編程語言,並使用PyTorch框架作為關鍵技術的實現示例,幫助讀者深入理解技術細節。本書可作為高等院校人工智慧、電腦科學及相關專業的本科生與研究生的教材,也可作為大模型領域技術人員的參考書。

作者介紹
編者:申富饒|責編:姚蕾//陳佳媛
    申富饒,南京大學人工智慧學院副院長,電腦軟體新技術全國重點實驗室教授、博導。先後在南京大學數學系獲學士、碩士學位,在日本東京工業大學獲博士學位。主要研究方向為神經網路、電腦視覺、機器人智能,主持多項國家級項目,出版教材、專著、譯著10余部。

目錄
前言
主要符號表
第1章  緒論
  1.1  大模型的定義
    1.1.1  大模型的核心特徵
    1.1.2  大模型與深度學習的關係
  1.2  大模型的發展歷程以及里程碑
    1.2.1  大模型的發展歷程
    1.2.2  大模型的里程碑
    1.2.3  重要組織及團隊
  1.3  大模型的應用場景
  1.4  大模型的研究問題
  1.5  大模型的未來挑戰
  1.6  小結
  練習
第2章  大模型技術的基石
  2.1  Transformer架構
    2.1.1  位置編碼
    2.1.2  注意力機制
    2.1.3  前饋網路
    2.1.4  殘差連接與歸一化
  2.2  基於Transformer的經典大模型及其架構
    2.2.1  編碼器架構
    2.2.2  解碼器架構
    2.2.3  編碼器-解碼器架構
  2.3  不同架構的優缺點以及適用場景分析
  2.4  分散式訓練與並行計算技術
    2.4.1  大模型訓練的挑戰
    2.4.2  數據並行訓練
    2.4.3  流水線並行訓練
    2.4.4  張量並行訓練
  2.5  小結
  練習
第3章  大模型核心技術
  3.1  從自監督到大模型預訓練
  3.2  預訓練任務
    3.2.1  自回歸
    3.2.2  自編碼與去噪
    3.2.3  對比學習
  3.3  對齊策略優化與模型訓練
    3.3.1  人類反饋強化學習
    3.3.2  混合訓練策略
  3.4  模型壓縮與效率提升
    3.4.1  剪枝
    3.4.2  模型量化
    3.4.3  知識蒸餾
  3.5  提示詞工程
    3.5.1  基礎提示優化
    3.5.2  人工提示優化
    3.5.3  自動提示優化

    3.5.4  思維鏈
  3.6  小結
  練習
第4章  大模型微調技術
  4.1  微調技術概述
    4.1.1  為什麼要微調
    4.1.2  微調技術分類
    4.1.3  高效參數微調的通用架構
  4.2  前綴微調
    4.2.1  原理與方法
    4.2.2  實現細節
    4.2.3  前綴向量的優化方法
  4.3  提示詞微調
    4.3.1  硬提示
    4.3.2  軟提示
    4.3.3  典型變體
    4.3.4  實現技術細節
  4.4  適配器微調
    4.4.1  原理與方法
    4.4.2  經典變體
  4.5  LoRA微調
    4.5.1  原理與方法
    4.5.2  經典變體
    4.5.3  實現技術細節
  4.6  微調技術比較
  4.7  小結
  練習
第5章  大模型檢索增強生成
  5.1  為什麼需要RAG
  5.2  RAG架構與工作原理
    5.2.1  檢索器
    5.2.2  生成器
    5.2.3  RAG的架構類型
  5.3  RAG中的數據準備與索引機制
    5.3.1  數據準備:統一文檔對象的構建
    5.3.2  文本分塊:讓長文變得「可消化」
    5.3.3  向量存儲與高效索引:讓大模型有「記憶力」
  5.4  檢索器系統優化技術
    5.4.1  查詢轉換
    5.4.2  重排序
    5.4.3  遞歸檢索
    5.4.4  混合檢索
    5.4.5  檢索器微調
  5.5  生成器系統增強機制
    5.5.1  提示工程
    5.5.2  解碼調優
    5.5.3  生成器微調
  5.6  小結
  練習
第6章  大模型的訓練數據和評估

  6.1  大模型與數據質量
    6.1.1  為什麼需要高質量數據
    6.1.2  數據質量對大模型的影響
  6.2  訓練數據收集與預處理
    6.2.1  數據收集
    6.2.2  數據預處理
    6.2.3  數據標注
  6.3  基準測試數據集介紹
    6.3.1  通用能力評估基準
    6.3.2  領域專項評估基準
    6.3.3  倫理安全評估基準
    6.3.4  新興任務評估基準
  6.4  大模型帶來的數據隱私與安全問題
    6.4.1  大模型數據隱私問題
    6.4.2  大模型安全問題
  6.5  小結
  練習
第7章  大模型部署
  7.1  使用開源大模型進行開發
  7.2  主流開源大模型介紹
    7.2.1  Meta Llama系列
    7.2.2  OpenAI Community GPT-2
    7.2.3  Google Gemma系列
    7.2.4  Alibaba Qwen系列
    7.2.5  DeepSeek系列
    7.2.6  總結
  7.3  Hugging Face介紹
    7.3.1  什麼是Hugging Face
    7.3.2  Hugging Face的核心功能
    7.3.3  Hugging Face的使用方法
    7.3.4  實例:使用Transformers進行情感分析
    7.3.5  運行環境與輸出示例
  7.4  基於開源大模型的構建
    7.4.1  選擇合適的開源模型
    7.4.2  在本地部署Qwen2-0.5B-Instruct模型
    7.4.3  構建Web界面
    7.4.4  運行和測試
  7.5  參數高效微調實戰
    7.5.1  LoRA概述
    7.5.2  實驗背景與目標
    7.5.3  實驗準備
    7.5.4  實驗實現
    7.5.5  實驗結果與分析
  7.6  檢索增強生成實戰
    7.6.1  檢索增強生成概述
    7.6.2  實驗背景與目標
    7.6.3  實驗準備
    7.6.4  實驗實現
    7.6.5  測試結果
  7.7  小結

  練習
參考文獻

  • 商品搜索:
  • | 高級搜索
首頁新手上路客服中心關於我們聯絡我們Top↑
Copyrightc 1999~2008 美商天龍國際圖書股份有限公司 臺灣分公司. All rights reserved.
營業地址:臺北市中正區重慶南路一段103號1F 105號1F-2F
讀者服務部電話:02-2381-2033 02-2381-1863 時間:週一-週五 10:00-17:00
 服務信箱:bookuu@69book.com 客戶、意見信箱:cs@69book.com
ICP證:浙B2-20060032