定位:为真实对话而非录音转写而生
官网首页的表述是「为真实对话打造的语音 AI」,产品口号则把两条线说得很直白:Flux 负责听,Flux TTS 负责说。它强调自己是「第一个对话感知的语音平台」,原生理解轮次转换、能处理打断、并在整段对话中保持上下文;同时说明这些能力可以在实时或批量模式下使用,也可以跑在云端或自托管环境里。这个定位说明它瞄准的不是「把录音转成文字」这一件事,而是让机器参与实时对话。
深度介绍
官网首页的表述是「为真实对话打造的语音 AI」,产品口号则把两条线说得很直白:Flux 负责听,Flux TTS 负责说。它强调自己是「第一个对话感知的语音平台」,原生理解轮次转换、能处理打断、并在整段对话中保持上下文;同时说明这些能力可以在实时或批量模式下使用,也可以跑在云端或自托管环境里。这个定位说明它瞄准的不是「把录音转成文字」这一件事,而是让机器参与实时对话。
官网把平台分为四块:语音转文字(实时转写、面向生产的准确率)、文本转语音(有表现力的音色、延迟最低约 80 毫秒)、语音智能体(一次接口调用完成实时对话)与音频智能(从每段对话中提取洞察)。四者共用同一套账号、密钥与计费体系,接口形态也保持一致。对工程团队的实际意义是:语音链路里的识别、合成与对话编排可以放在同一个供应商下完成,而不是分别对接三家再把结果拼起来。
官网特别强调「统一」这件事:通常搭建语音智能体需要把语音识别、文本转语音与大模型编排三段分别接起来,而 Deepgram 把它们合并到一套接口里,官方给出的收益是降低复杂度、延迟与成本。页面上的流程示意是:用户语音输入先经识别,再交给模型编排并结合业务逻辑与外部系统,最后由语音合成说出来。这类一体化方案的优势在链路可控,代价是可替换性下降——选型时可以确认每一段是否仍能独立替换模型。
识别侧按用途分了四类模型:Flux STT 面向实时语音智能体,内置轮次判断、自然打断处理与超低延迟,覆盖 10 种语言;Nova-3 面向生产级转写,官方称在准确率、抗噪与多语言上表现最好,覆盖 50 多种语言;行业定制模型面向医疗、法律与金融等领域的专有词汇与结构;此外还可基于自有数据训练定制模型。官方给出的延迟口径是转写在 300 毫秒内返回,并强调在嘈杂、带口音或多人重叠说话时仍能保持准确率。
合成侧当前主推 Flux TTS,官方的说法是「第一个说话前先思考的语音模型」——在整个对话中保持语气、表达与连贯性,而不是逐句独立合成。官网同时给出了一段限时活动信息:该模型可免费使用至 9 月 12 日,期间美国区最多 45 路并发流、欧盟与澳洲区最多 5 路。对人机对话场景,语音合成的稳定性与情绪连贯性往往比单句音质更影响体验,评估时建议按整段对话来听,而不是只听单句样本。
价格页的规则比较直白:注册即赠送 200 美元额度,用完后转为按量计费,无最低消费、额度不过期、无需信用卡;Growth 档按年预付费用购买额度,官方称最多可省 20%,起价为每年 4,000 美元以上,额度按实际用量抵扣;企业版按需报价。各接口还设有并发上限,免费与按量档、Growth 档的数值不同(例如识别接口的流式并发上限分别为 150 与 225)。具体单价随模型与促销变化,官网以「现价/原价」并列展示,例如 Flux 英语流式的促销价约为每分钟 0.0065 美元。
除云端接口外,官网单独设有自托管页面,面向需要在自有环境中运行语音服务的企业;企业侧还提供定制模型与面向呼叫中心、语音分析、对话式 AI、播客转写与医疗转写的解决方案。这类能力通常与数据合规、时延与成本相关:例如医疗转写涉及隐私与审计,呼叫中心则关注高并发下的稳定性。官网另列出「Powered by Deepgram」计划,面向把语音能力嵌入自家产品的平台与合作伙伴。
官方新闻稿显示,Deepgram 于 2026 年 1 月 13 日宣布完成 1.3 亿美元 C 轮融资,估值 13 亿美元,由 AVP 领投。公告说明这笔资金用于推进其面向实时语音 AI 的接口平台、支持「Powered by Deepgram」计划、完成对 OfOne 的收购(把实时语音自动化拓展到餐饮免下车场景)、扩充专利组合,并在旧金山设立新的语音 AI 协作中心。对选型者而言,这说明供应商具备持续投入的能力,但融资与并购信息应以官方公告为准。
产品特点
官方称其为「对话感知」平台:原生处理轮次转换、打断与上下文延续,Flux STT 与 Flux TTS 分别负责听与说,并可在实时或批量模式下使用。
语音识别、文本转语音与大模型编排由一套接口与一个语音智能体接口承载,官方称这样能降低集成的复杂度、延迟与成本,代价是链路内各组件的可替换性需要额外确认。
Flux STT 面向实时对话(10 种语言、内置轮次判断),Nova-3 面向生产转写(50 多种语言、强调抗噪),另有医疗、法律与金融的行业定制模型和基于自有数据的定制训练。
既可直接调用云端接口,也提供自托管部署页面与企业定制方案,另有面向呼叫中心、语音分析、对话式 AI、播客与医疗转写的行业解决方案。
最近动态
官方新闻稿显示公司完成 1.3 亿美元 C 轮融资、估值 13 亿美元,由 AVP 领投;资金用于推进实时语音接口平台、支持合作计划、完成对 OfOne 的收购、扩充专利组合,并在旧金山设立语音 AI 协作中心。
官网当前显示 Flux TTS 可免费使用至 9 月 12 日,活动期间美国区最多 45 路并发流式连接、欧盟与澳洲区最多 5 路;同时把该模型描述为「说话前先思考」的语音模型,强调整段对话中的语气与表达连贯性。
语音转文字页面当前列出 Flux STT(对话式、10 种语言、内置轮次判断与打断处理)、Nova-3(生产转写、50 多种语言、强调抗噪与多语言)、行业定制模型(医疗、法律、金融)与自定义模型四类,并给出转写在 300 毫秒内返回的延迟口径。
价格页当前列出按量计费(先赠 200 美元额度)与 Growth 预付档(每年 4,000 美元起、最多省 20%)以及企业档,并按接口给出并发上限:识别接口 REST 为 50、流式为 150 或 225,合成与语音智能体为 45 或 60,音频智能为 10。单价随模型与促销变化,请以官网当期表格为准。
Deepgram 是一家做企业级语音 AI 的厂商。官网的定位是「为真实对话打造的语音 AI」,产品口号把两条主线概括为「Flux STT 负责听、Flux TTS 负责说」,并强调自己是对话感知的平台:原生理解轮次转换、能处理打断,并在整段对话中保持上下文;这些能力既可在实时模式下使用,也可用于批量处理,部署上支持云端与自托管。 产品线覆盖语音转文字、文本转语音、语音智能体与音频智能四块,其中语音智能体接口把识别、合成与大模型编排合并到一套接口中,官方称这样能降低集成的复杂度、延迟与成本。识别侧按用途分为四类模型:Flux STT 面向实时语音智能体,内置轮次判断与打断处理,覆盖 10 种语言;Nova-3 面向生产级转写,覆盖 50 多种语言并强调抗噪表现;另有面向医疗、法律与金融的行业定制模型以及基于自有数据的定制训练。官方给出的转写延迟口径是 300 毫秒内返回,并称在嘈杂、带口音或多人重叠说话时仍能保持准确率。 合成侧当前主推 Flux TTS,官方称其为「说话前先思考」的语音模型,强调在整段对话中保持语气与表达连贯性,并给出限时免费活动与并发额度。计费方面,注册赠送 200 美元额度后按量计费,无最低消费;Growth 档按年预付最多可省 20%,起价每年 4,000 美元以上;企业版按需报价。各接口设有并发上限,免费与按量档、Growth 档数值不同,单价随模型与促销变化,官网以「现价/原价」并列展示。 公司层面,官方新闻稿显示其于 2026 年 1 月 13 日完成 1.3 亿美元 C 轮融资、估值 13 亿美元,资金用于推进实时语音接口平台、支持合作计划、完成对 OfOne 的收购、扩充专利组合并在旧金山设立协作中心。使用前建议注意三点:一体化接口在降低拼接成本的同时会削弱单点替换的灵活性;并发上限与单价直接影响成本模型,应按自己的峰值通话量估算;医疗、法律等场景涉及数据合规,需要先确认自托管或私有部署选项是否满足要求。
核验信息
本页事实来自 Deepgram 官方渠道:官网首页(对话感知定位、四条产品线、统一语音智能体接口的流程说明、企业与合作伙伴路径)、语音转文字页面(Flux STT、Nova-3、行业定制与自定义模型的划分及延迟口径)、文本转语音页面(Flux TTS 的定位与限时活动)、价格页(按量计费、Growth 预付档、企业档与各接口并发上限、折扣与促销单价)、自托管页面,以及 2026 年 1 月 13 日的 C 轮融资公告。功能、价格与并发数值核验于 2026 年 9 月 22 日,请以官方当期说明为准。
Deepgram介绍页面对您是否有帮助?