现在好不容易把基础的调用跑通了,新的问题又来了。我们做的这个问答系统,设想是能接入我们专业领域的一个小型知识库,让模型回答得更精准。但具体这个“知识库”该怎么接进去呢?我看一些文章提到可以通过向量数据库或者微调,但 API 层面有没有更直接、更“标准”一点的做法?大家现在都是怎么处理这个问题的?是得自己搭建一整套检索增强生成(RAG)的架子,还是说某些 API 已经提供了封装好的接口或者最佳实践范式?我们项目时间有限,希望有个相对清晰、可复现的路径。
而且我们很担心费用和性能问题。这项目后期可能会模拟多用户同时提问,那 API 的并发请求数怎么提升?如果同时来很多人,会不会因为限流导致请求失败或者响应特别慢?另外,每次请求的 token 消耗看着账单都肉疼,虽然现在有免费额度,但真用起来肯定不够。有没有什么技巧能有效减少 token 的消耗?比如在提示词设计上,或者对返回结果的处理上?感觉这些优化点直接关系到我们项目最终能不能顺畅地演示出来。
感觉现在 AI 工具发展很快,但相关的、接地气的开发指南,特别是针对我们这种国内学生开发者的、能从头讲到尾并且包含这些实战坑点解答的资料,真的太少了。论坛里的大佬们,你们在做类似项目的时候,是怎么解决文档、知识库接入、并发和费用这些实际问题的?有没有什么经验或者踩过的坑可以分享?拜托了!