REAL-TIME CAPTION · ASR · LLM TRANSLATION

让每一种声音,
即时变成
可理解的语言。

见言seesound 捕获手机系统音频,将视频、直播、会议和课程中的语音实时转写,并通过大模型翻译成可读字幕。

11:44
EN
JA
ZH

They are talking over each other. Wait, wait, let me finish.

他们正在互相抢话。等等,让我说完。

248ASR segments
189translations
60sstress run
System Audio Capture Aliyun Fun-ASR Qwen MT Flash Overlay Subtitles

ENGINE STACK

从声音到字幕的实时链路

01

系统音频捕获

通过 Android MediaProjection 与 AudioPlaybackCapture 获取视频、直播和应用内媒体声音。

02

流式语音识别

PCM 音频流实时送入 ASR,引擎持续返回 partial 与 final 结果,适配快语速与多人场景。

03

上下文翻译

将转写文本送入 qwen-mt-flash,结合最近语境输出更自然的中文字幕。

04

悬浮字幕呈现

字幕覆盖层保持在视频上方,可调字体、透明度和位置,适合横竖屏观看。

SCENARIOS

为真实复杂的声音场景设计

多人直播 · 弹幕 · 笑声

当四个人同时开口,字幕仍要跟上。

面向虚拟主播直播、综艺节目、圆桌访谈和跨语言会议,见言会持续保存 ASR 与翻译链路,方便复盘质量。

快语速英语

新闻、脱口秀、真人秀与课堂视频。

日语综艺

棚内吐槽、嘉宾插话、节目音效混合。

移动学习

在手机上直接看外语内容,不再来回复制链接。

FIELD TEST

用压力测试驱动产品迭代

437 指定 B 站链接总记录
248 ASR 片段
189 翻译片段
10 final ASR 句段

COMING SOON

付费版正在完善中

支付能力、应用商店上架、前端体验优化和更多语言场景测试将陆续完成。我们正在邀请第一批重度用户共同打磨真实字幕体验。