从 LLM 的文字接龙讲起,顺着 Prompt、Memory、Agent、RAG、Function Calling、MCP、Skill、Workflow 一路往上,用尽量简明的方式说明这些名词各自补哪块短板、落在哪一层。
Read More
从 Graph / State / Node / Edge 讲起,结合 Hello World、生成-评估循环、持久化、人机交互、时间旅行与流式,再到多 Agent 协作与计划执行,说明 LangGraph 解决什么问题、各组件如何配合、怎么把一个 Agent 工作流真正跑起来。
Read More
记录在 NVIDIA DGX Spark 上部署 Qwen3.5 122B-A10B 模型,并通过混合量化、MTP 推测解码、INT8 LM Head 等技术将推理速度提升至 46.88 tok/s(相对于 baseline 28.3 tok/s 提升 65.6%)
Read More
记录在 NVIDIA Jetson Thor 上使用 vLLM 部署 Qwen 系列模型的过程,包括单Thor环境配置与服务启动、双 Thor 级联跨设备分布式推理
Read More
面向 RK1820/RK1828 的入门综述:协处理器定位、与 RK3588 的协同关系、1820 与 1828 的差异,以及 RKLLM / RKNN3 双路径部署与实测数据。
Read More