Nas 的天空
  • Home
  • Mac
  • Nas
  • Python
  • Ai-Studio
  • Other
  • Home
  • Mac
  • Nas
  • Python
  • Ai-Studio
  • Other
Mac快捷键使用技巧

置顶 Mac Mac快捷键使用技巧

        Mac 电脑的快捷键可以显著提升工作效率,特别是在文字处理、多任务操作和系统操作上。如果你经常…

2,608次阅读 0个评论
Mac 2024-11-06
单卡跑满并发:从 vLLM 到 SGLang 的高吞吐推理调优与流式代理踩坑记

技术前沿与洞察 单卡跑满并发:从 vLLM 到 SGLang 的高吞吐推理调优与流式代理踩坑记

针对本地大模型与多轮 Agent 场景下的并发性能瓶颈,本文基于单卡 RTX 4090 实测对比 SGLang 与 vLLM。深入拆解 RadixAttention 前缀缓存机制、显存精细化分配策略,并提供生产级 Nginx SSE 流式反向代理配置与压测排障指南,大幅降低首字延迟并压榨硬件极限。

6次阅读 0个评论
技术前沿与洞察 近一天内
NAS玩转本地大模型与Agent:基于Ollama+Open-WebUI+Qdrant搭建私有知识库避坑实录

Nas NAS玩转本地大模型与Agent:基于Ollama+Open-WebUI+Qdrant搭建私有知识库避坑实录

把家用或小团队NAS改造成离线大模型推理中心与RAG私有知识库,是释放低功耗算力的最佳途径。本文详细记录在群晖与TrueNAS等Linux环境下,利用Docker部署Ollama、Open-WebUI并外挂Qdrant向量数据库的完整实战流程,涵盖N卡/核显直通陷阱、显存内存分层调度优化以及高吞吐知识检索配置。

6次阅读 0个评论
Nas 近一天内
手搓低延迟本地AI网关:基于FastAPI与LiteLLM的高并发流式缓存实战

极客折腾记 手搓低延迟本地AI网关:基于FastAPI与LiteLLM的高并发流式缓存实战

本地部署DeepSeek/Qwen等开源大模型时,高并发与长上下文往往导致TTFT暴涨和显存吃紧。本文基于FastAPI与LiteLLM手搓一套轻量级流式AI网关,深度集成语义缓存与动态排队限流,给出完整配置与实测压测数据,将首字延迟压降60%以上。

7次阅读 0个评论
极客折腾记 近一天内
Apple Silicon压榨指南:MLX生态下本地满血微调与量化实战

Mac Apple Silicon压榨指南:MLX生态下本地满血微调与量化实战

别让你的M系列芯片只跑Ollama当聊天玩具。本文基于Apple Silicon统一内存架构与MLX框架,详解如何在macOS上满血运行Llama-3/Qwen2.5的LoRA微调与4-bit量化转换。包含虚拟内存限制解除、Metal统一内存显存分配调优、全流程量化脚本及避坑实测,单机榨干Mac的本地AI生产力。

18次阅读 0个评论
Mac 近两天内
单卡4090跑满吞吐:vLLM与FastAPI流式网关高并发工程化改造实战

极客折腾记 单卡4090跑满吞吐:vLLM与FastAPI流式网关高并发工程化改造实战

单张RTX 4090部署大模型做线上服务,并发一上来就OOM、首字延迟(TTFT)飙升到秒级?本文分享我将vLLM底层推理引擎与自研FastAPI流式代理网关整合的实战方案。包含PagedAttention核心显存调优、SSE断流重试容错、动态批处理参数压测以及完整的Docker Compose生产级配置,手把手带你榨干单卡性能。

25次阅读 0个评论
极客折腾记 近三天内
实战踩坑:基于 vLLM + One-API 搭建自建与聚合的大模型高并发生产级网关

AI工具与实战 实战踩坑:基于 vLLM + One-API 搭建自建与聚合的大模型高并发生产级网关

本文分享如何使用 vLLM 部署本地开源大模型(以 Qwen2.5 为例),结合 One-API 搭建兼具高吞吐并发、动态负载均衡与 Fallback 降级能力的统一 API 网关。包含显存显卡分配陷阱(CUDA OOM)、流式 SSE 代理超时调优、多卡并行配置以及真实压测数据。

26次阅读 0个评论
AI工具与实战 近三天内
单机双卡打造高可用AI网关:vLLM与LiteLLM流式代理、Prefix Caching与动态降级实战

Ai-Studio 单机双卡打造高可用AI网关:vLLM与LiteLLM流式代理、Prefix Caching与动态降级实战

记录在自建双卡工作站上基于 vLLM 与 LiteLLM 构建私有化 OpenAI 兼容网关的实操全流程。深度解析 AWQ 量化吞吐调优、Prefix Caching 提速 300% 实测、Nginx 流式 SSE 缓冲截断排查,以及 GPU 满载或异常时秒级熔断降级至公网模型的工程化落地指南。

27次阅读 0个评论
Ai-Studio 近三天内
实战踩坑:基于 FastAPI 与 Asyncio 搭建高并发 LLM SSE 流式代理服务

Python 实战踩坑:基于 FastAPI 与 Asyncio 搭建高并发 LLM SSE 流式代理服务

本文记录使用 Python FastAPI 与 Asyncio 重构 LLM 流式代理网关的实操经验。针对高并发场景下大模型 SSE(Server-Sent Events)长连接导致的内存泄漏、协程雪崩、连接池耗尽以及客户端断开后的显存空转问题,提供完整的背压控制、连接生命周期管理与带压测对比的生产级工程化代码。

26次阅读 0个评论
Python 近三天内
NAS玩转本地私有知识库:Docker轻量部署vLLM+Qwen2.5与Dify实战调优

Nas NAS玩转本地私有知识库:Docker轻量部署vLLM+Qwen2.5与Dify实战调优

嫌公有云大模型API按量扣费太肉疼?本文分享我在自建TrueNAS/Debian宿主机上,利用Docker容器化低延迟跑通vLLM、Qwen2.5与Dify全功能私有化知识库的实操全流程。深度解析NVIDIA-Container-Toolkit透传、显存与上下文优化、GPU P2P排障及混合检索调优实测。

30次阅读 0个评论
Nas 五天前
单卡4090跑满吞吐:vLLM多并发流式代理架构与KV Cache避坑实战

Ai-Studio 单卡4090跑满吞吐:vLLM多并发流式代理架构与KV Cache避坑实战

单张消费级显卡部署高并发开源大模型时,首字延迟突增与显存碎片化是致命痛点。本文基于vLLM结合FastAPI与Nginx构建高并发流式代理架构,拆解PagedAttention显存管理机制,详解真实生产压测数据、Chunked Prefill与多流转发配置,并附赠显存OOM与TCP连接悬挂的硬核排障指南。

30次阅读 0个评论
Ai-Studio 五天前
  • 1
  • 2
  • 3
  • ...
  • 44
  • »
Nas的天空
Nas的天空
点亮思维火花,畅享数字世界
用户数
1
文章数
431
评论数
28
阅读量
168920
One Word
-「」
Latest articles
单卡跑满并发:从 vLLM 到 SGLang 的高吞吐推理调优与流式代理踩坑记

单卡跑满并发:从 vLLM 到 SGLang 的高吞吐推理调优与流式代理踩坑记

针对本地大模型与多轮 Agent 场景下的并发性能瓶颈,本文基于单卡 RTX 4090 实测对比 SGLang 与 vLLM。深入拆解 RadixAttention 前缀缓存机制、显存精细化分配策略,并提供生产级 Nginx SSE 流式反向代理配置与压测排障指南,大幅降低首字延迟并压榨硬件极限。
NAS玩转本地大模型与Agent:基于Ollama+Open-WebUI+Qdrant搭建私有知识库避坑实录

NAS玩转本地大模型与Agent:基于Ollama+Open-WebUI+Qdrant搭建私有知识库避坑实录

把家用或小团队NAS改造成离线大模型推理中心与RAG私有知识库,是释放低功耗算力的最佳途径。本文详细记录在群晖与TrueNAS等Linux环境下,利用Docker部署Ollama、Open-WebUI并外挂Qdrant向量数据库的完整实战流程,涵盖N卡/核显直通陷阱、显存内存分层调度优化以及高吞吐知识检索配置。
手搓低延迟本地AI网关:基于FastAPI与LiteLLM的高并发流式缓存实战

手搓低延迟本地AI网关:基于FastAPI与LiteLLM的高并发流式缓存实战

本地部署DeepSeek/Qwen等开源大模型时,高并发与长上下文往往导致TTFT暴涨和显存吃紧。本文基于FastAPI与LiteLLM手搓一套轻量级流式AI网关,深度集成语义缓存与动态排队限流,给出完整配置与实测压测数据,将首字延迟压降60%以上。
Apple Silicon压榨指南:MLX生态下本地满血微调与量化实战

Apple Silicon压榨指南:MLX生态下本地满血微调与量化实战

别让你的M系列芯片只跑Ollama当聊天玩具。本文基于Apple Silicon统一内存架构与MLX框架,详解如何在macOS上满血运行Llama-3/Qwen2.5的LoRA微调与4-bit量化转换。包含虚拟内存限制解除、Metal统一内存显存分配调优、全流程量化脚本及避坑实测,单机榨干Mac的本地AI生产力。
单卡4090跑满吞吐:vLLM与FastAPI流式网关高并发工程化改造实战

单卡4090跑满吞吐:vLLM与FastAPI流式网关高并发工程化改造实战

单张RTX 4090部署大模型做线上服务,并发一上来就OOM、首字延迟(TTFT)飙升到秒级?本文分享我将vLLM底层推理引擎与自研FastAPI流式代理网关整合的实战方案。包含PagedAttention核心显存调优、SSE断流重试容错、动态批处理参数压测以及完整的Docker Compose生产级配置,手把手带你榨干单卡性能。
Latest Comments
hello world hello world hello world hello world
web site web site It's hard to find knowledgeable people on this topic, however, you seem like you know what you're talking about! Thanks
site site You made some really good points there. I looked on the internet to learn more about the issue and found most individuals will go along with your views on this site.
1xbet clone script 1xbet clone script Hello friends, good paragraph and pleasant arguments commented at this place, I am in fact enjoying by these.
buy casino script buy casino script An intriguing discussion is worth comment. I do believe that you should write more on this topic, it may not be a taboo matter but typically people do not speak about such topics. To the next! Many thanks!!
casino api casino api I'm excited to find this website. I wanted to thank you for your time for this fantastic read!! I definitely liked every bit of it and i also have you book marked to check out new information on your site.
gudanggacor gudanggacor It's in reality a great and helpful piece of info. I am happy that you shared this useful information with us. Please stay us informed like this. Thank you for sharing.
macau18 link alternatif macau18 link alternatif Thanks for any other fantastic article. Where else may anyone get that type of information in such an ideal method of writing? I have a presentation subsequent week, and I am at the look for such information.
all about casino comped cruises all about casino comped cruises Hi, i read your blog from time to time and i own a similar one and i was just curious if you get a lot of spam comments? If so how do you reduce it, any plugin or anything you can recommend? I get so much lately it's driving me insane so any help is very much appreciated.
medical boric powder medical boric powder I'm not sure why but this site is loading very slow for me. Is anyone else having this issue or is it a problem on my end? I'll check back later and see if the problem still exists.
热评文章
NAS玩转本地私有知识库:Docker轻量部署vLLM+Qwen2.5与Dify实战调优

NAS玩转本地私有知识库:Docker轻量部署vLLM+Qwen2.5与Dify实战调优

嫌公有云大模型API按量扣费太肉疼?本文分享我在自建TrueNAS/Debian宿主机上,利用Docker容器化低延迟跑通vLLM、Qwen2.5与Dify全功能私有化知识库的实操全流程。深度解析NVIDIA-Container-Toolkit透传、显存与上下文优化、GPU P2P排障及混合检索调优实测。
实战踩坑:用 Python + vLLM 搭建生产级大模型流式网关(高并发+背压处理)

实战踩坑:用 Python + vLLM 搭建生产级大模型流式网关(高并发+背压处理)

本文手把手带你基于 Python、FastAPI 与 vLLM 搭建生产级大模型流式代理网关。深度解析 SSE 长连接内存泄漏、客户端断开连接导致的算力白嫖(背压与取消传播)、流式分词解码乱码等真实生产踩坑经验,并附完整的异步流式反向代理架构与压测对比。
本地vLLM+Nginx流式网关高并发调优:突破TTFT延迟与显存瓶颈实战

本地vLLM+Nginx流式网关高并发调优:突破TTFT延迟与显存瓶颈实战

针对本地自建大模型API服务在高并发流式响应(SSE)下的卡顿、显存OOM与TTFT首字延迟飙升问题,本文基于vLLM与Nginx构建高并发流式代理生产架构。结合PagedAttention参数调优、流式反向代理缓冲穿透、动态Batching配置与压测实测数据,详解极客运维与工程落地的避坑指南。
友情链接
Practical Workplace English Hub
Tag Cloud
__init__.py@classmethod@语法**enter****exit**\*\*kwargs\*argsAdvanced Mac TipsAdvanced PythonAdvanced QueriesAgent开发AIAI DeploymentAIGCaiohttpAI入门androidAnti-blockingAnti-ScrapingAPIAPI DevelopmentAPI SecurityAPI接口API文档API集成Apple SiliconArgparseassertasyncAsynchronous Programming
Copyright©2013-2025 Nas的天空 nassky.top 版权所有
 Theme by Puock