Nas 的天空
点亮思维火花,畅享数字世界
用户数
1
文章数
432
评论数
28
阅读量
168954
Latest articles
NAS玩转本地私有Agent:vLLM + Open WebUI高吞吐流式架构与踩坑调优
很多极客给家庭或团队NAS插上RTX 4090/3090后,直接跑Ollama搞AI助手,并发稍高或长上下文时常卡顿甚至爆显存。本文基于自建NAS(Debian/TrueNAS),分享一套生产级本地私有LLM推理与Agent工作流搭建方案:采用vLLM作为高性能推理后端,接入Open WebUI与SearXNG构建联网搜索Agent,详解PagedAttention显存分配、跨容器直连优化及长上下文压测踩坑实战。
单卡跑满并发:从 vLLM 到 SGLang 的高吞吐推理调优与流式代理踩坑记
针对本地大模型与多轮 Agent 场景下的并发性能瓶颈,本文基于单卡 RTX 4090 实测对比 SGLang 与 vLLM。深入拆解 RadixAttention 前缀缓存机制、显存精细化分配策略,并提供生产级 Nginx SSE 流式反向代理配置与压测排障指南,大幅降低首字延迟并压榨硬件极限。
NAS玩转本地大模型与Agent:基于Ollama+Open-WebUI+Qdrant搭建私有知识库避坑实录
把家用或小团队NAS改造成离线大模型推理中心与RAG私有知识库,是释放低功耗算力的最佳途径。本文详细记录在群晖与TrueNAS等Linux环境下,利用Docker部署Ollama、Open-WebUI并外挂Qdrant向量数据库的完整实战流程,涵盖N卡/核显直通陷阱、显存内存分层调度优化以及高吞吐知识检索配置。
手搓低延迟本地AI网关:基于FastAPI与LiteLLM的高并发流式缓存实战
本地部署DeepSeek/Qwen等开源大模型时,高并发与长上下文往往导致TTFT暴涨和显存吃紧。本文基于FastAPI与LiteLLM手搓一套轻量级流式AI网关,深度集成语义缓存与动态排队限流,给出完整配置与实测压测数据,将首字延迟压降60%以上。
Apple Silicon压榨指南:MLX生态下本地满血微调与量化实战
别让你的M系列芯片只跑Ollama当聊天玩具。本文基于Apple Silicon统一内存架构与MLX框架,详解如何在macOS上满血运行Llama-3/Qwen2.5的LoRA微调与4-bit量化转换。包含虚拟内存限制解除、Metal统一内存显存分配调优、全流程量化脚本及避坑实测,单机榨干Mac的本地AI生产力。
Popular articles
用 Python 驾驭 JSON/XML 数据:高效解析与灵活转换的实践指南
引言:数据时代的基石——JSON 与 XML 在当今信息爆炸的时代,数据是驱动一切的核心。无论是 Web AP...
Python基础入门 Day141 异步系统中的优先级调度与资源分配:让重要任务先完成
在上一节中,我们系统梳理了异步任务从创建到完成的完整生命周期。本篇将在此基础上,继续解决一个在真实工程中必然出...
Python 高效爬虫实战:requests+BeautifulSoup 避坑与优化全攻略
在数字信息爆炸的时代,从海量互联网数据中提取有价值信息已成为许多领域的核心需求。Python 以其简洁、强大的...
Python基础入门 Day136 高并发系统核心:消息队列思想与异步解耦
在完成异步任务平台的基本架构之后,我们会很快遇到一个系统级瓶颈:组件之间的耦合开始限制系统扩展能力 。本篇将围...
Python 正则表达式完全指南:掌握复杂匹配,解锁高级数据处理能力 | 实战案例解析
在 Python 的世界里,正则表达式(Regular Expressions,简称 RegEx)是处理字符串...