幫助中心 | 我的帳號 | 關於我們

vLLM與SGLang(大模型高效推理雙引擎實戰)/通用智能與大模型叢書

  • 作者:編者:李明飛|責編:鄭柳潔
  • 出版社:電子工業
  • ISBN:9787121531767
  • 出版日期:2026/08/01
  • 裝幀:平裝
  • 頁數:468
人民幣:RMB 99 元      售價:元
放入購物車
加入收藏夾

內容大鋼
    本書以vLLM與SGLang兩大主流開源推理框架為核心,系統講解其從理論基礎到生產部署的完整知識體系,是面向演算法工程師與系統工程師的實戰參考手冊。
    全書共14章,分為3部分。第1部分(第1?4章)夯實理論基礎,涵蓋Transformer推理機制、KV緩存原理、連續批處理、FlashAttention、投機解碼等核心演算法,幫助讀者建立紮實的推理優化認知體系。第2部分(第5?12章)以項目驅動的方式深入實踐,內容涵蓋長文檔處理、結構化輸出、多模態實時視頻理解、多智能體協作、生產級服務部署與監控,以及基於vLLM的DeepSeek-V4長上下文推理服務等典型工程場景,每章均提供可直接復用的完整工程代碼。第3部分(第13?14章)聚焦進階優化與技術前沿,系統梳理模型量化、分散式推理、軟硬體協同等高階技術路徑,並對以DeepSeek-V4為代表的新一代模型架構發展趨勢與推理框架演進方向做出研判與展望。
    本書注重工程嚴謹性,力求做到開卷即用、經得起生產環境的檢驗。無論是希望系統入門推理優化的工程師,還是尋求在生產實踐中進一步提升系統性能的資深從業者,均可從本書中獲得切實的啟發。

作者介紹
編者:李明飛|責編:鄭柳潔
    李明飛,清華大學軟體學院軟體工程專業碩士,電腦科學教育專家。現任教育部學位與研究生教育發展中心學位論文評審專家,長期從事數據智能與人工智慧領域的技術研究、工程實踐與人才培養工作。在大模型原理、Agent系統設計、大模型推理方向有系統深入的研究積累,對vLLM、SGLang等推理引擎的底層機制與性能優化有深入理解,有豐富的生產級落地經驗。

目錄
第1章  大模型推理技術演進與挑戰
  1.1  大模型推理的核心痛點
    1.1.1  內存牆問題與KV緩存優化需求
    1.1.2  推理延遲與吞吐量的平衡難題
    1.1.3  多樣化部署場景的適配挑戰
  1.2  主流推理框架技術譜系
    1.2.1  從HuggingFace Transformers到專用推理引擎
    1.2.2  vLLM與SGLang的技術定位
  1.3  本書技術選型邏輯
  本章參考文獻
第2章  vLLM核心技術解析
  2.1  vLLM架構與設計哲學
    2.1.1  整體架構概覽
    2.1.2  vLLM設計哲學的三大原則
    2.1.3  PagedAttention機制深度剖析
    2.1.4  連續批處理的原理
    2.1.5  KV緩存管理策略
  2.2  vLLM性能優化技術
    2.2.1  運算元融合與CUDA內核優化
    2.2.2  張量並行與流程並行實現
    2.2.3  投機解碼支持
  2.3  OpenAI兼容介面與服務接入
第3章  SGLang核心技術解析
  3.1  SGLang架構與創新理念
    3.1.1  結構化生成語言的設計哲學
    3.1.2  RadixAttention共享前綴優化機制
    3.1.3  程序化提示工程範式
  3.2  SGLang的獨特優化技術
    3.2.1  約束解碼的實現原理
    3.2.2  多輪對話上下文管理優化
  3.3  SGLang的編程模型
第4章  vLLM與SGLang技術對比
  4.1  性能維度分析
    4.1.1  KV緩存管理的兩種哲學
    4.1.2  批量吞吐:數據、原因與邊界條件
    4.1.3  延遲的多維分解與尾延遲控制
    4.1.4  前綴感知調度的定量收益模型
    4.1.5  內存效率與硬體適配範圍
  4.2  功能特性對比
    4.2.1  結構化輸出:從提示工程到約束解碼
    4.2.2  前綴共享:自動化程度與操作模型
    4.2.3  服務介面、模型支持與分散式能力
  4.3  場景驅動的選型決策框架
    4.3.1  以工作負載特徵為第一判斷依據
    4.3.2  硬體環境對選型的約束
    4.3.3  團隊與組織因素
    4.3.4  混合部署:適用條件與完整成本評估
  4.4  工程實踐:部署、監控與長期維護
    4.4.1  部署配置:關鍵參數與常見陷阱
    4.4.2  監控體系的建立

    4.4.3  版本管理與長期維護
  本章參考文獻
第5章  基礎環境搭建與性能基準測試
  5.1  項目背景與目標
    5.1.1  驗證目標:建立性能基線
    5.1.2  理論印證:從假設到實驗的方法論
  5.2  環境準備與依賴配置
    5.2.1  CUDA與PyTorch基礎環境配置
    5.2.2  vLLM與SGLang分別安裝部署
    5.2.3  測試數據集設計與準備
  5.3  測試框架架構設計
    5.3.1  設計約束與技術方案選擇
    5.3.2  公共指標數據結構
    5.3.3  統一資源監控模塊
    5.3.4  統一測試引擎
  5.4  框架測試實現與執行
    5.4.1  vLLM伺服器配置與啟動
    5.4.2  SGLang伺服器配置與啟動
    5.4.3  完整測試執行流程
    5.4.4  結果對比分析工具
  5.5  效果驗證
    5.5.1  預期結果分析與理論對照
    5.5.2  數據可視化方法
    5.5.3  常見問題與排查方法
    5.5.4  測試方法論總結
第6章  實戰項目1:高併發API服務(vLLM生產部署)
  6.1  需求分析與技術方案推導
    6.1.1  業務約束的量化
    6.1.2  框架選型的量化推導
    6.1.3  系統架構設計
  6.2  項目準備
    6.2.1  模型選擇與量化方案決策
    6.2.2  vLLM服務配置詳解
    6.2.3  服務啟動驗證
  6.3  核心實現
    6.3.1  FastAPI網關
    6.3.2  輸入截斷的實現細節
    6.3.3  Nginx配置
    6.3.4  Prometheus監控體系
  6.4  優化迭代
    6.4.1  基線測試與性能分析
    6.4.2  第一輪優化:max-num-seqs的機制與尋優
    6.4.3  第二輪優化:提升GPU利用率
    6.4.4  第三輪優化:長尾延遲的根因分析與處置
  6.5  效果驗證
    6.5.1  驗證方法論:如何判斷測試結果是可信的
    6.5.2  完整優化路徑的對比驗證
    6.5.3  Grafana監控面板配置
  6.6  場景延伸:多模型部署與灰度發布
    6.6.1  多模型部署的方案對比

    6.6.2  灰度發布的決策框架
第7章  實戰項目2:結構化數據提取系統(SGLang優勢場景)
  7.1  項目需求與技術方案
    7.1.1  場景:簡歷信息批量結構化提取
    7.1.2  約束解碼與前綴緩存的實際價值
    7.1.3  技術選型:SGLang + Pydantic + JSON Schema
  7.2  項目準備
    7.2.1  SGLang服務部署
    7.2.2  簡曆數據集構建
    7.2.3  Pydantic數據模型定義
  7.3  核心實現
    7.3.1  SGLang約束解碼提取流程
    7.3.2  JSON Schema生成與欄位驗證
    7.3.3  批量處理流程
  7.4  優化迭代
    7.4.1  提示工程優化
    7.4.2  結構化輸出的容錯處理
    7.4.3  RadixAttention前綴緩存效果驗證
  7.5  效果驗證
    7.5.1  提取準確率評估
    7.5.2  處理速度基準測試
    7.5.3  前綴緩存命中率分析
  7.6  場景延伸
    7.6.1  合同條款智能審查
    7.6.2  醫療報告結構化分析
    7.6.3  金融輿情實體抽取
第8章  實戰項目3:多輪對話Agent系統
  8.1  項目需求與技術方案
    8.1.1  場景:旅遊規劃智能助手
    8.1.2  技術選型
  8.2  項目準備
    8.2.1  ChatGLM-3-6B模型選擇、部署與能力驗證
    8.2.2  工具集成的核心設計原則
    8.2.3  對話狀態管理設計
  8.3  核心實現
    8.3.1  SGLang聲明式對話流程編排
    8.3.2  工具調用決策鏈路實現
    8.3.3  上下文窗口滑動管理
  8.4  優化迭代
    8.4.1  對話策略優化
    8.4.2  自動前綴緩存效率驗證
  8.5  效果驗證
    8.5.1  任務完成率超過90%
    8.5.2  緩存復用收益:推理成本降低40%
第9章  實戰項目4:實時視頻內容理解推理加速
  9.1  項目需求與技術方案
    9.1.1  場景定義
    9.1.2  瓶頸分析與四層優化路徑
    9.1.3  技術選型
  9.2  項目準備

    9.2.1  模型準備
    9.2.2  視頻幀提取與多模態消息構建
    9.2.3  延遲測量框架與多模態推理基線
  9.3  核心實現
    9.3.1  優化層1:FlashAttention-2集成
    9.3.2  優化層2:visual token壓縮
    9.3.3  優化層3:跨幀KV緩存前綴復用
    9.3.4  優化層4:多模態投機解碼
  9.4  優化迭代
    9.4.1  visual token數量與延遲—精度的權衡分析
    9.4.2  投機解碼k值掃描
    9.4.3  多路併發與動態批處理協調
  9.5  效果驗證
    9.5.1  消融實驗:各優化項獨立貢獻量化
    9.5.2  綜合評估:延遲—吞吐量—精度三維權衡
    9.5.3  能耗效率分析(token/Watt)
  本章參考文獻
第10章  實戰項目5:混合架構生產系統(雙框架系統)
  10.1  項目需求與技術方案
    10.1.1  場景:企業級AI平台的多場景融合需求
    10.1.2  技術背景:推理框架與Kubernetes的深度耦合關係
    10.1.3  技術選型與版本基線
  10.2  項目準備
    10.2.1  Kubernetes集群節點規劃與模型權重預載入
    10.2.2  資源配額與優先順序設計
    10.2.3  網關選型與基礎路由配置
  10.3  核心實現
    10.3.1  vLLM服務部署與自動擴/縮容
    10.3.2  SGLang任務專用Pod部署
    10.3.3  智能路由策略
  10.4  系統層優化
    10.4.1  跨框架負載均衡演算法
    10.4.2  故障轉移與降級策略
  10.5  資源層優化
    10.5.1  Spot實例混合調度機制
    10.5.2  成本模型與資源利用率分析
  10.6  效果驗證
    10.6.1  端到端可用性監控體系
    10.6.2  統一監控視圖與告警規則
    10.6.3  故障注入測試方案
第11章  實戰項目6:長文本處理優化(前綴緩存深度應用)
  11.1  項目需求與技術方案
    11.1.1  場景定義
    11.1.2  模型選型的依據
    11.1.3  張量並行策略選型
    11.1.4  完整的四層前綴結構方案
  11.2  項目準備
    11.2.1  長文本數據集構建
    11.2.2  內存預算規劃
    11.2.3  基線性能測試

  11.3  核心實現
    11.3.1  SGLang RadixAttention
    11.3.2  vLLM塊級前綴緩存
    11.3.3  兩種緩存實現的結構性差異
    11.3.4  緩存命中率監控體系的構建
  11.4  優化迭代
    11.4.1  前綴分段策略
    11.4.2  緩存淘汰策略調優
    11.4.3  緩存容量上限的邊界場景與降級策略
    11.4.4  多文檔並行處理流程設計
  11.5  效果驗證
    11.5.1  實驗條件與命中率統計方法
    11.5.2  端到端吞吐量與處理延遲的對比
    11.5.3  顯存佔用基準分析
第12章  實戰項目7:基於vLLM的DeepSeek-V4長上下文推理服務
  12.1  百萬Token時代的推理工程挑戰
  12.2  DeepSeek-V4架構要點與vLLM適配分析
  12.3  環境準備與模型部署
  12.4  長上下文服務配置調優
  12.5  生產場景:長文檔問答服務
  12.6  性能基準與瓶頸分析
第13章  性能調優實戰指南
  13.1  系統級性能瓶頸診斷
    13.1.1  GPU性能剖析工具鏈
    13.1.2  PyTorch Profiler與應用層追蹤
    13.1.3  常見性能反模式的識別與根治
  13.2  框架參數調優決策樹
    13.2.1  vLLM關鍵參數影響矩陣
    13.2.2  SGLang配置項優化路徑
    13.2.3  硬體資源配比黃金法則
  13.3  生產環境監控與告警
    13.3.1  關鍵指標體系構建
    13.3.2  異常檢測與根因分析
    13.3.3  容量規劃與成本預測
第14章  技術演進趨勢與未來展望
  14.1  推理系統的架構範式演進
    14.1.1  預填充—解碼分離
    14.1.2  混合專家模型的大規模部署
    14.1.3  超長上下文的內存系統重構
    14.1.4  硬體—軟體協同設計的新範式
  14.2  SGLang與vLLM的路線分歧與生態格局
    14.2.1  兩大框架的技術路徑分析
    14.2.2  生態格局重塑
    14.2.3  商業化與開源並軌
  14.3  推理系統研究前沿
    14.3.1  推理時計算的調度挑戰
    14.3.2  KV緩存壓縮的系統權衡
    14.3.3  Agentic推理的架構需求
  14.4  從工程實踐到系統研究
    14.4.1  生產觀測反哺研究的方法論

    14.4.2  開源貢獻的高價值切入點
    14.4.3  持續跟蹤前沿的資源體系

  • 商品搜索:
  • | 高級搜索
首頁│ 新手上路│ 客服中心│ 關於我們│ 聯絡我們│ Top↑│
Copyrightc 1999~2008 美商天龍國際圖書股份有限公司 臺灣分公司. All rights reserved.
營業地址:臺北市中正區重慶南路一段103號1F 105號1F-2F
讀者服務部電話:02-2381-2033 02-2381-1863 時間:週一-週五 10:00-17:00
 服務信箱:bookuu@69book.com 客戶、意見信箱:cs@69book.com
ICP證:浙B2-20060032