Nas 的天空
点亮思维火花,畅享数字世界
用户数
1
文章数
428
评论数
28
阅读量
167852
Latest articles
Apple Silicon压榨指南:MLX生态下本地满血微调与量化实战
别让你的M系列芯片只跑Ollama当聊天玩具。本文基于Apple Silicon统一内存架构与MLX框架,详解如何在macOS上满血运行Llama-3/Qwen2.5的LoRA微调与4-bit量化转换。包含虚拟内存限制解除、Metal统一内存显存分配调优、全流程量化脚本及避坑实测,单机榨干Mac的本地AI生产力。
单卡4090跑满吞吐:vLLM与FastAPI流式网关高并发工程化改造实战
单张RTX 4090部署大模型做线上服务,并发一上来就OOM、首字延迟(TTFT)飙升到秒级?本文分享我将vLLM底层推理引擎与自研FastAPI流式代理网关整合的实战方案。包含PagedAttention核心显存调优、SSE断流重试容错、动态批处理参数压测以及完整的Docker Compose生产级配置,手把手带你榨干单卡性能。
实战踩坑:基于 vLLM + One-API 搭建自建与聚合的大模型高并发生产级网关
本文分享如何使用 vLLM 部署本地开源大模型(以 Qwen2.5 为例),结合 One-API 搭建兼具高吞吐并发、动态负载均衡与 Fallback 降级能力的统一 API 网关。包含显存显卡分配陷阱(CUDA OOM)、流式 SSE 代理超时调优、多卡并行配置以及真实压测数据。
单机双卡打造高可用AI网关:vLLM与LiteLLM流式代理、Prefix Caching与动态降级实战
记录在自建双卡工作站上基于 vLLM 与 LiteLLM 构建私有化 OpenAI 兼容网关的实操全流程。深度解析 AWQ 量化吞吐调优、Prefix Caching 提速 300% 实测、Nginx 流式 SSE 缓冲截断排查,以及 GPU 满载或异常时秒级熔断降级至公网模型的工程化落地指南。
实战踩坑:基于 FastAPI 与 Asyncio 搭建高并发 LLM SSE 流式代理服务
本文记录使用 Python FastAPI 与 Asyncio 重构 LLM 流式代理网关的实操经验。针对高并发场景下大模型 SSE(Server-Sent Events)长连接导致的内存泄漏、协程雪崩、连接池耗尽以及客户端断开后的显存空转问题,提供完整的背压控制、连接生命周期管理与带压测对比的生产级工程化代码。
Popular articles
用 Python 驾驭 JSON/XML 数据:高效解析与灵活转换的实践指南
引言:数据时代的基石——JSON 与 XML 在当今信息爆炸的时代,数据是驱动一切的核心。无论是 Web AP...
Python基础入门 Day141 异步系统中的优先级调度与资源分配:让重要任务先完成
在上一节中,我们系统梳理了异步任务从创建到完成的完整生命周期。本篇将在此基础上,继续解决一个在真实工程中必然出...
Python 高效爬虫实战:requests+BeautifulSoup 避坑与优化全攻略
在数字信息爆炸的时代,从海量互联网数据中提取有价值信息已成为许多领域的核心需求。Python 以其简洁、强大的...
Python基础入门 Day136 高并发系统核心:消息队列思想与异步解耦
在完成异步任务平台的基本架构之后,我们会很快遇到一个系统级瓶颈:组件之间的耦合开始限制系统扩展能力 。本篇将围...
Python 正则表达式完全指南:掌握复杂匹配,解锁高级数据处理能力 | 实战案例解析
在 Python 的世界里,正则表达式(Regular Expressions,简称 RegEx)是处理字符串...