Video to Text
video2text.netVideo to Text 是一款 AI 驱动的转录平台,可将音频、视频文件以及公开的社交媒体链接转换为带有时间戳的多语言文本转录稿,适用于多种专业和个人场景。
浏览收录在 翻译及抄录 分类中的 AI 产品。按产品名称搜索、了解每个工具的用途,并进入详情页查看更多信息。
本页显示 32 个产品
Video to Text 是一款 AI 驱动的转录平台,可将音频、视频文件以及公开的社交媒体链接转换为带有时间戳的多语言文本转录稿,适用于多种专业和个人场景。
Gemini 3.5 Transcribe 是一款专为精确、实时转录设计的语音转文字模型,能够处理复杂的音频环境、填充词以及多发言人归属识别。
SubtitleGenerator 是一款基于浏览器的工具,提供 AI 驱动的转录、样式设置和纠错功能,支持视频文件在整个处理过程中保留在用户的本地设备上,确保了隐私与效率。
Nitro 4.0 是一款专为 AI 代理设计的人工翻译 API,使其能够在无需 API 密钥的情况下,自主下单并支付专业的人工翻译服务,实现全自动化的内容本地化流程。
Zen Whisper 是一款 Mac 离线语音转文字软件。支持 110 种语言听写与文件转录,核心识别在本地完成,适配 Apple Silicon 芯片,提供低延迟的流畅体验 — Mac 语音转文字软件
Lispr 是一款专为 macOS 11+ 用户设计的轻量级(约 4MB)语音输入与即时翻译利器。它采用强大的 Whisper large-v3 语音模型,支持 34 种原生语言,能够实现约 0.2 秒的极速转录。用户只需通过简单的按键组合即可在任何应用程序中直接输入翻译后的文本,无需切换应用或复制粘贴。Lispr 由 Codebridge 开发,通过 Apple 公证,确保隐私安全且无账号门槛。
OpenTypeless是一款功能强大的开源AI语音输入工具,支持Windows、macOS和Linux系统。它通过集成Deepgram、OpenAI Whisper等STT技术和Claude、Gemini等LLM模型,实现在任何应用程序中通过语音输入并自动进行AI文本润色。用户可自由配置API密钥,支持99种语言实时转录,是传统听写软件的高效替代方案。
Gemini 3.5 Live Translate是Google推出的突破性音频模型,支持70多种语言的近乎实时语音转语音翻译。该模型能够精准捕捉并还原说话者的音调与语速,实现自然流畅的交流。无论是通过Google Translate应用、Google Meet远程会议,还是通过Gemini Live API进行开发者集成,Gemini 3.5 Live Translate都在重新定义跨语言沟通的效率与体验,助力全球用户跨越语言鸿沟。
Wave 是一款原生 macOS 听写应用,通过本地 Whisper 或极速 Groq 技术将语音即时转化为文字。它主打隐私保护,无需账号,支持 AI 意图识别与文本重写,是提升 macOS 输入效率的理想开源工具。
Lingo.dev 是一款革命性的本地化工程平台,通过将翻译流程转化为可配置的基础设施,彻底改变了传统本地化模式。它采用先进的检索增强本地化(RAL)技术,通过本地化引擎持久化术语表、品牌语调和特定语言模型链,使术语错误减少高达 59%。Lingo.dev 支持 API、CLI、GitHub Action 等多种集成方式,为开发者提供类似 Stripe 的极致体验,是企业实现高效、高一致性全球化扩张的首选方案。
Tiny Aya 是由 Cohere Labs 开发的高性能、开源多语言 AI 模型系列。其参数量为 33.5 亿(3.35B),专为在本地硬件和移动设备上运行而优化。Tiny Aya 突破了传统大模型对基础设施的依赖,在翻译、语言理解和数学推理方面表现卓越。该系列包含基础版 Base、通用指令微调版 Global 以及针对非洲、南亚等地区的专业化版本,致力于让全球开发者和研究人员能够构建符合自身文化背景的 AI 应用。
Visual Translate 是一款革命性的 AI 视频翻译工具,能够自动识别、擦除并重构视频中的屏幕文字。与传统翻译不同,它不仅处理音频,还能完美本地化视频视觉层,支持幻灯片、产品演示及培训视频。用户可在导出前进行编辑、调整样式与动画。它是企业和创作者实现全球化视频本地化的核心环节,可无缝衔接字幕、配音及口型同步功能,提升视频专业度与品牌一致性。
Stage Captions 是一款专为现场活动、会议及直播设计的实时自动字幕生成软件。无需安装,直接通过浏览器即可将语音精准转化为文字,并实时传输至场馆大屏、直播间及观众设备。凭借低延迟引擎、自定义词典及二维码即时观看功能,该软件能大幅提升活动的无障碍水平与互动性。支持 OBS 及专业转播系统集成,是体育赛事、教育讲座及企业活动的首选方案。
Voxtral Transcribe 2 是由 Mistral AI 推出的先进语音转文本模型系列,包含 Voxtral Mini Transcribe V2 和 Voxtral Realtime。该系列支持 13 种语言,具备高精度说话人日志、超低延迟实时转录及上下文偏置功能。Voxtral 以行业领先的成本效益提供 Apache 2.0 开源权重,助力企业构建高效、安全的语音 AI 应用,如语音助手、会议智能和呼叫中心自动化。
Typeless 是一款革命性的 macOS 语音输入工具,旨在彻底取代传统键盘。它利用先进 AI 技术将自然语言实时转化为精炼、格式化的文本。Typeless 支持 100 多种语言,具备自动删除语气词、纠正口误、智能排版及根据应用场景自动调整语调等核心功能。通过 Typeless,用户能以每分钟 220 字的速度进行高效创作,同时享有最高级别的隐私保护,是提升工作效率的终极利器。
Lufe.ai 是一款领先的 AI 翻译浏览器插件,专为双语学习者和专业人士打造。它整合了 OpenAI、Gemini 和 Claude 等主流大模型,提供精准的网页对照翻译、PDF 翻译及图片翻译。通过首创的“一行外语一行母语”双语显示模式,用户能无缝浏览 Discord、Twitter、维基百科等平台。插件支持全球 100 多种语言,具备划词翻译、语音朗读及自定义翻译样式功能,是提升英语阅读效率与语言学习能力的最佳 AI 工具。
AI漫画翻译器通过先进的AI技术,快速、精准地将漫画翻译成多种语言,保持原版的情节、语气与布局,支持PDF、图像上传及多模型切换,满足用户的不同翻译需求。
视频转录AI是一款在线工具,能在几秒钟内将视频转化为准确的文本,支持MP4、YouTube、Zoom等多种格式,适用于学生、教师、内容创作者和专业人士。
这款AI驱动的PDF翻译器能够快速且准确地在线翻译您的PDF文档,同时完美保留原始布局,支持多语言翻译,完全免费使用。
莎士比亚翻译器是一款专业的AI工具,能够无缝地在现代英语和莎士比亚英语之间进行翻译。用户可以免费使用,不需要注册,操作简单,不仅适合文学学生和作家,也适合语言爱好者。
MeaningsLab 是一个全面的在线词典,提供准确的单词含义、同义词和用法示例,适合学生、作家和语言学习者。
Doculator是一款强大的AI驱动文档翻译工具,支持超过100种语言,提供高效、准确的翻译服务,适用于各种文件格式,确保格式保留和隐私保护,满足个人及企业用户的多种需求。
Transmonkey 是一款功能强大的 AI 翻译软件,支持超过130种语言,包括英文、中文、日文、法文、德文等,能够翻译几乎所有文件格式,包括文档、图片、视频等。使用先进的大型语言模型,提供高精度的翻译服务,帮助用户跨越语言障碍,轻松完成文件翻译、视频字幕翻译、语音配音等多种任务。支持实时翻译和批量下载,方便快捷,是各类个人和企业用户的理想翻译解决方案。
Crowdin是一个强大的本地化管理平台,专为敏捷团队设计。它提供了600多个集成和插件,支持70多种文件格式,并具有AI辅助翻译功能。Crowdin可以自动化您的内容翻译流程,帮助您轻松管理多语言项目。无论是软件、移动应用、网站还是营销内容,Crowdin都能帮助您快速高效地将产品本地化,进入全球市场。它的协作功能、灵活的工作流程和强大的报告工具,使得本地化过程变得简单而透明。
图片翻译器可以将图片、官方文件、菜单截图或任何含有字符的图像中的文字进行翻译。使用先进的OCR技术,支持多语言翻译,提供即时结果,用户界面友好,完全免费使用,保证隐私和安全。适用于旅行、教育、商业、医疗等多种场景。
VOICECHEAP是一款基于AI的视频配音应用,支持30多种语言的翻译和配音。它利用先进的AI技术,大幅降低传统配音服务成本,并提供语音克隆、字幕生成等功能。
DeepL翻译是全球最精准的翻译工具,支持多达32种语言,提供文档翻译、语音翻译和多种应用集成,保障数据安全。
AssemblyAI提供领先的语音AI模型,将语音数据转化为文字,适用于电话、虚拟会议和播客等场景。产品包括精确的语音转文字、说话人检测、情感分析、章节检测、PII(个人身份信息)去除等功能。最新的Universal-1模型在12.5百万小时的多语言音频数据上训练,具备超高精度。AssemblyAI易于集成,提供详细的API文档和代码示例,支持按需付费,确保随着使用量增长定价合理。我们的AI团队不断改进和更新模型,提供24/7客户支持,帮助用户加速产品开发。
Otter.ai是一款强大的AI会议笔记记录和实时AI转录工具,可以自动记录会议笔记、生成摘要和行动项,并提供实时转录服务,帮助提高团队生产力。
CloneDub 是一个专业的视频配音平台,用户可以上传文件并开始配音,还支持一键下载SRT、音频和视频文件。配音速度取决于视频/音频长度和语音克隆技术。选择我们的高级计划可以更快完成配音。用户可以随时取消或续订订阅计划,并购买额外的分钟数。若遇到问题,我们会提供支持和帮助。
功能限流器是一种用来限制每个IP请求频率的产品。它能有效防止频繁访问,保护服务器资源,确保系统稳定运行。适用于各种网络服务和API接口的保护,是保障网络安全和优化性能的理想选择。
TurboScribe 是一款先进的AI转录服务,能够快速准确地将音频和视频转换为文本,支持98多种语言,提供无限制的转录功能,适用于会议、采访、播客等场景,确保数据私密安全。
此目录汇总归入 翻译及抄录 分类的产品。你可以先通过产品简介建立候选清单,再进入详情页查看已提供的功能和定价信息,然后访问官方网站。