This channel is part of the discussion
黑洞资源笔记 appears in 16 event pages on TGList【从首字延迟到工程闭环:一份每天 30 分钟的 LLM 推理优化路线图】 GitHub 最近走红的 time-to-first-token 项目为工程师提供了一个为期 10 周的系统学习方案。不同于零散的 Demo 演示,它要求参与者在 50 个课时内持续迭代同一个 OpenAI 兼容的推理服务。 内容覆盖了从 Roofline 模型分析、vLLM 与 SGLang 源码解读,到量化压缩、投机采样以及在 Kubernetes 上的存算分离部署。最终目标是让开发者在租用的 GPU 上,完成支撑 1000…
【让 AI 拥有顶级审美:Lieflat Charts 重新定义 Agent 的数据表达】 Lieflat Charts 是一个专门为 AI Agent 设计的数据可视化 Skill。它不再让 AI 盲目调用绘图库,而是通过一套包含 Lupi(叙事型)、Glance(快读型)等风格的视觉语法,让 AI 能根据数据意图自动生成精致、可交互的 HTML 图表或整页报告。它支持 Claude Code、Codex 等主流工具,通过简单的指令就能把枯燥的 CSV 变成具备编辑质感的视觉作品。…
【从首字延迟到工程闭环:一份每天 30 分钟的 LLM 推理优化路线图】 GitHub 最近走红的 time-to-first-token 项目为工程师提供了一个为期 10 周的系统学习方案。不同于零散的 Demo 演示,它要求参与者在 50 个课时内持续迭代同一个 OpenAI 兼容的推理服务。 内容覆盖了从 Roofline 模型分析、vLLM 与 SGLang 源码解读,到量化压缩、投机采样以及在 Kubernetes 上的存算分离部署。最终目标是让开发者在租用的 GPU 上,完成支撑 1000…
一个系统化的 LLM 推理实践库:100 Days of Inference 基于 Philip Kiely《Inference Engineering》,以可运行脚本与笔记带你从单 GPU 运行时优化(量化、KV Cache、CUDA 内核、Flash/Speculative decoding)到多机扩展(容器化、自动扩缩、路由)、观测与生产化部署,覆盖视觉/语音等多模态与前沿技术(MoE、长上下文)。每日实战、可复现实验与可视化,适合工程师从原理到生产快速上手与复现。 家用 DGX Spark 集群示例与完整课程路径已包含。
【Jev:让AI像“直觉”一样快且准的系统一模型】 OpenAI前研究员Diogo Almeida创立的TypeSafe AI发布了新模型Jev,它不生成文本,而是专为软件自动化设计的“决策机器”。 通过自研的RLCD训练方法和并行采样架构,Jev能将非结构化文本直接转化为类型安全的JSON决策,其推理速度比主流大模型快20-200倍,成本降低40-400倍,且输出端完全免费。 这件事的重要性在于它打破了“万物皆可Chat”的路径依赖。开发者常困扰于大模型在自动化链路中的高延迟、易幻觉和解析报错,而Jev通过放弃生成长文本的自由,换取了绝对的类型安全和…
youtuber