人类对话与 AI 交互之间的差距正在缩小,但延迟仍然是实现真正沉浸感的重大障碍。Smallest.ai 正通过摒弃庞大、缓慢的 LLM,转向专门设计用于模仿人类认知模式的、超快速的小型语音模型来应对这一挑战。
超越大语言模型的延迟
当前的 AI 语音代理经常面临“先提示后处理”的延迟。在标准的 LLM 工作流中,系统会等待完整的音频片段,处理文本,然后生成响应。正如 Smallest.ai 创始人兼 CEO Sudarshan Kamath 所指出的,这种停顿会立刻暴露用户正在与机器对话。
Smallest.ai 的方法模仿了人类的神经生物学:同时进行倾听、思考和说话。其专有的微型语音模型旨在处理实时智能,几乎实现零响应延迟。通过专注于小型、专门的模型而非庞大的基础模型,这家初创公司旨在实现中断功能和自然的对话流,其目标是通过速度和细微差别有效地“突破图灵测试”。
面向企业级智能的双模型架构
Smallest.ai 正在为 AI 代理架构提出一种新标准。该公司并不强求单个大模型处理所有事务,而是倡导一种两层系统:
- 小型语音模型 (The Small Voice Model): 一个实时智能层,负责管理即时的、流动的对话细微差别,包括口音、多种语言和嘈杂环境。
- “离线”LLM (The "Offline" LLM): 一个较大的基础模型,仅在查询超出小型模型的特定知识库时才会被调用。
当小型模型遇到复杂问题时,它会模仿人类代理,通过将通话者短暂置于“等待”状态,利用较大的 LLM 来研究问题。这种混合方法确保了即使在需要高层推理时,对话体验也能保持无缝衔接。
市场定位与竞争格局
凭借由 Seligman Ventures 领投的 1300 万美元 A 轮融资——使总融资额超过 2100 万美元——Smallest.ai 正将自己定位为语音 AI 经济的核心基础设施。这家初创公司并不打算构建端到端的客户支持平台;相反,它提供的是像 RingCentral 和 Truecaller 这样公司已经在使用的专业语音层。
虽然 ElevenLabs 等竞争对手侧重于音频配音和播客,而 Cartesia 或 Sarvam 等其他公司则针对特定的区域利基市场,但 Smallest.ai 则专注于实时企业级对话代理。Kamath 认为,对于像 Sierra 和 Decagon 这样的客户支持初创公司来说,完善高保真、低延迟的语音会分散其核心业务的注意力,这使得 Smallest.ai 专门的“即插即用”模型成为一种战略必然。
核心要点
- 专业化效率: Smallest.ai 利用小型、专用的语音模型来实现近乎零的延迟,避免了传统大规模 LLM 固有的延迟。
- 混合智能: 公司采用双模型策略,使用快速的小型模型进行实时交互,使用较大的 LLM 处理复杂的深度推理任务。
- 基础设施重心: Smallest.ai 并不直接与客户支持平台竞争,而是提供关键的语音技术层,从而实现更自然、更像人类的 AI 代理。
总结
Smallest.ai 筹集的 1300 万美元将用于资助一个专门构建的两层语音 AI 技术栈,该技术栈以牺牲庞大 LLM 的通用性为代价,换取微型、任务导向型模型的高速度。其承诺很明确:通过消除目前定义了大多数语音助手的尴尬停顿,让 AI 对话感觉像与真人交谈一样自然。随着企业开始将该技术嵌入到现实世界的通话流程中,其收益是否会超过增加的工程开销将变得明朗。
