GitHub - sriti-ai/sriti-core: Sriti Core 是一个针对大语言模型的开源、高效智能路由代理与级联引擎

📌 One-Sentence Summary
Sriti Core 是一款开源的智能路由代理与级联引擎,通过多层编排优化 LLM 成本与延迟。
📝 Summary
Sriti Core 提供了一个开源框架,旨在通过智能路由高效管理大语言模型。它采用了三级级联策略:本地模型(Tier 3)、高性价比云提供商(Tier 2)以及前沿模型(Tier 1)。核心功能包括使用 ONNX 进行本地任务分类、基于 Redis/Valkey 的语义缓存、提示词压缩,以及在底层未通过质量门关或 SLO 时自动将任务升级到高层的可靠性驱动机制。
💡 Main Points
三级级联架构
系统并非将所有请求都发送到昂贵的前沿模型,而是尝试使用本地模型解决任务,其次是高性价比的云 API,仅在必要时使用前沿模型。
智能语义缓存与分类
利用 fastembed 进行零样本任务分类,并在 Redis 中基于向量的相似性跳过重复查询的 API 调用,从而显著降低延迟和成本。
基于可靠性的编排
该引擎使用指数移动平均(EMA)跟踪模型性能(延迟、成功率),根据历史奖励和实时质量门关调整路由偏好。
面向效率的功能
包括通过 LLMLua 进行提示词压缩以减小上下文大小,并使用 AES-256 GCM 加密确保静态存储缓存数据的安全性。
💬 Key Quotes
Sriti Core 是一个针对大语言模型的开源、高效智能路由代理与级联引擎。
与其将每一条请求都路由到昂贵的前沿模型……Sriti 会动态对其进行分类、检查加密缓存,并在模型分层结构中进行级联。
Sriti 持续学习模型可靠性,评估输出质量,并在大幅减少云端成本的同时严格保障 SLO。
📊 Article Meta
AI Screening: 89
Source: Hacker News - Newest: "LLM"
Author: sudevs
Category: 人工智能
Language: 英文
Read Time: 5 min
Word Count: 1085
Tags:
Large Language Models , AI Routing , Open Source , Model Inference , Performance Optimization
支持作者,持续关注中。
不错不错,已加入书签。
内容翔实,正好需要,先收藏再看。
这个比较实用,已转发给同事。
点赞,必须点赞
赞同,实践出真知。
有没有更详细的教程,期待后续。
不错不错,已加入书签。
这篇文章分析得很透彻,收藏了!
这个比较实用,已转发给同事。
作者写得真不错,学到了不少。
看完了,收获满满,期待更多更新。