四十年来,我们用符号向机器解释。 现在,用话说。

面向 Windows 的语音输入、智能体与自动补全。在任何程序之上。

与您现有的工作流无缝集成

CursorClaudeChatGPTCopilotVS CodeJetBrainsZedSlackTelegramWhatsAppGmailNotionObsidianDocsFigmaLinearChromeCursorClaudeChatGPTCopilotVS CodeJetBrainsZedSlackTelegramWhatsAppGmailNotionObsidianDocsFigmaLinearChrome

速度

说话比打字快。快得多。

日常对话语速约为每分钟 150 个词。打字平均每分钟 40 个词,这还没算上您回头修改错别字的时间。

语音输入150 每分钟字数
键盘输入40 每分钟字数

左侧时钟记录了所有过程:语音、识别、格式化和插入--与第一个屏幕显示的三个阶段相同。程序在您说话时也不会显示草稿。右侧显示的是以每分钟 40 个词的速度打字并带有一个错别字的情况。

第二步

任何人都能进行转录。区别在于接下来会发生什么。

普通的听写只会给您一串文字,需要您手动清理。Midri Voice 能识别出您在哪里进行了自我修正、哪里是一个想法的结束,以及哪些内容是不应该出现在文本中的。

原始听写

所以嗯我看了那个报告呃关于第三个不关于第四季度的销售情况

“第三个--不,第四个”是自我修正。只有您真正想表达的内容才会留在文本中。

语音对话

不是指令,而是交流

它会在您说话时实时倾听并直接以语音回应,无需中间转录。您可以随时打断、追问或改变主意。

打开 Spotify 并播放一些舒缓的音乐

助手正在打开 Spotify

提醒我半小时后参加会议

助手没问题。当此对话开启时,我会在七点提醒您

从您说完话到它发出声音仅需 1.4 秒

拥有“双手”的助手

说出来,就等于做完

您说出需求,最多三个工作单元会同时处理。每项权限均需单独授予,默认仅开启一项--查看屏幕。

MidriMidri Voice

助手权限

助手在电脑上被允许执行的操作

这是您的电脑和文件。请仅开启您打算使用的功能:权限可随时撤销,但已执行的操作无法撤回。

询问频率权限决定了允许执行的操作。此项决定了助手在执行操作前询问的频率
总是询问独立工作,在不可逆操作前停止从不询问
查看屏幕屏幕截图和窗口内容。若不开启此项,助手将无法获取屏幕信息
启动程序打开并切换已安装的程序
处理文件读取、创建、修改及重命名文件。删除操作将移至回收站,而非永久删除
运行命令PowerShell 命令。程序内已拦截破坏性命令,即使在任何权限下也不会执行
使用浏览器打开并阅读网页,进行点击操作--在执行程序自带的浏览器中,即您已登录的那个。它无法查看您的浏览器标签页

你的

它长成你想要的样子

四种形状,七套配色。挑一个,或者看它自己换。

点一下形状或颜色

当你还是要打字时

半句话早已在你脑子里

它替你把开了头的话写完--就在你真正打字的那个窗口里,而不是我们的窗口。合适就按 Tab;不合适就继续打,它会一声不响地消失。

Slack
#团队
A
Ann10:12
已推送导出任务的修复程序,现在应该会更快了。
M
Max10:15
太好了。我将重新运行夜间任务并核对数据。
按你的修复重跑了夜间构建,导出用了四分钟,而不是十一分钟。
1你停下手
2它给出下半句
3按 Tab 收下

代码与提示词

向编辑器口述提示词--术语保持原样

“Use state”会变成 useState,“task dashboard”会变成 TaskDashboard。名称会根据发音以及您屏幕上打开的内容进行还原。

助手
~/项目
助手准备就绪。请描述任务。

Claude Sonnet

代码名称根据发音和屏幕上打开的内容进行还原。

mainTypeScript第7行,第22列
与您现有的工作流无缝集成CursorClaudeChatGPTCopilotVS CodeJetBrainsZed

边说边译

说您的语言--直接转化为对方的语言

翻译不是事后的独立步骤,而是按键操作的一部分。支持 25 种语言;您只需在设置中选择一次目标语言。

Slack
#team
D
Dana13:48
已推送导出任务的修复程序,现在应该会更快了。
I
Ivan13:55
太好了。我将重新运行夜间任务并核对数据。
M
Mark14:02
能否请您再查看一下这个合并请求?
EN嗨!感谢您的修改,我已经修复了一切并再次发送给您。

插入到: ES

消息 #team

他人的文本

选中它,即可用您自己的语言阅读

工具栏会自动出现在选中文本的上方。翻译卡片中设有提问栏:您可以通过语音或打字询问文本内容或语气。

Telegram
J
James
最近在线
今天
预发布环境部署完成了吗?
18:54
是的,一小时前已完成,日志显示正常。
18:57
很好。不过还有一件事。
19:03
在迁移问题解决前,发布工作已暂停--我宁愿晚点发布,也不愿导致生产环境崩溃。
19:12
消息

文字聊天

有时候不能开口说话。但你仍然可以问。

通过快捷键即可在当前工作窗口上方调用它。它能记住语音助手所记忆的内容,调用相同的工具,并按其逻辑进行回答--在第三行文字生成时,您已读完第一行。

季度报告.docx

您正在工作。没有打开浏览器标签页,也没有可切换的内容。

记忆

不是事实清单,而是知识网

普通记忆是文件中的行,通过匹配关键词搜索。而这里的记忆由链接构建:新节点会自动寻找关联,在回溯时,助手会沿着链接寻找并带回邻近的关联信息。

MidriMidri Voice
对话记忆
搜索记忆
名字叫 Max擅长 TypeScript周二站会“店面”项目第四季度销售报告偏好简短回答时区 - 莫斯科询问过迁移事宜使用 Slack
9 个节点·保存在此计算机上显示全部
150每分钟字数

日常对话语速

1.4

从您的最后一个词到语音回答

25语言

插入时的翻译语言

功能介绍

一个助手,替代十个窗口

语音对话、操作应用程序和文件、设置提醒、个性化配置,以及最初的听写功能。

助手

当您与它对话时,它所做的一切。

10

语音回复,而非文字

它会在您说话的同时进行倾听并直接以语音回复,无需中间转录过程。从您说完到听到回复仅需约 1.5 秒。

“打开 Spotify”--即刻开启

它能识别所有已安装的应用并按名称启动。如果您要求打开已在运行的应用,它会直接切换到该窗口,而不会重复打开。

独立的浏览器,不占用您的标签页

助手拥有一个独立的 Chromium 浏览器及其专属配置文件:它仅在该浏览器内读取页面、点击和填写表单。您只需在其中登录一次所需的网站。浏览器需单独下载:下载大小 149 MB,占用磁盘空间 344 MB。

三十种音色可选

低沉平稳、活泼轻快、柔和从容--您可以在球形菜单或设置中切换音色。免费版包含其中两种。

看见您所见

共享屏幕并询问屏幕内容:读取错误信息、引导操作步骤或解读陌生窗口。

对话中语音提醒

“半小时后提醒我”--只要对话窗口处于打开状态,半小时后它会直接语音告知。这不是通知,而是对话中的一句提示。

听写

您的语音转化为文字的过程。

9

无网也能工作

识别功能在您的电脑上运行。断网后听写功能依然可用,并按规则进行优化。您的语音绝不会发送至任何地方。

您的专属名称与术语

GitHub、macOS 和 Kubernetes 等四十五个常用名称会自动识别。您可以添加无限长度的列表--系统将通过发音进行匹配。

您的屏幕即提示

活动窗口中的名称会自动加入当前短语的词典。当您提到“Slack”时,它会准确地显示为 Slack。

任意按键或组合键

右侧 Alt、Caps Lock、Ctrl+Shift 等,支持单个按键或组合键。像使用对讲机一样,按住即可说话。

自定义写作规则

“商务语气”、“无感叹号”、“短句”--用文字描述规则,系统会自动应用于每一句短语。

绝不丢失任何内容

您听写的所有内容都触手可及,点击即可重新粘贴。数据仅存储在您的电脑上。

本地运行

当您不使用时,它在您设备上的状态。

4

九大板块,井然有序

包含听写、文本处理、聊天、Live AI、连接器、历史记录、外观、系统及订阅信息。助手的权限及其工作模型位于“Live AI”中,您可在此开启对话。支持主题、十二种强调色、窗口材质及面板停靠边缘设置。

闲置时仅为细条

在您触碰前,面板仅显示在屏幕边缘。悬停即可展开麦克风、对话、助手和设置选项,离开后自动收起。

支持使用自有密钥

如果您不希望通过我们付费,可粘贴来自 OpenAI、Anthropic、Google 或其他提供商的密钥,其模型将与我们的模型并列供您使用。密钥存储在 Windows 凭据管理器中,绝不会传输给我们。

在侧边运行

面板不会获取焦点,不会弹出遮挡您的工作内容,也不会移动光标。仅在一种情况下助手会打开独立窗口--即您已授权其使用浏览器时。

安装

您的语音绝不会离开您的电脑

识别过程在本地模型上运行,无需联网,不会发送任何数据。使用程序需要账户,账户用于开启云端功能:智能处理、翻译、语音朗读及助手服务。

macOS

计划中

尚未就绪

Linux

计划中

尚未就绪

程序目前处于封闭测试阶段,暂无公开版本。请创建账户,一旦版本可用,我们将第一时间通知您。macOS 和 Linux 版本已在规划中,但尚未开始开发。

价格

你的电脑算的,免费。我们的服务器算的,收费

识别在你的机器上运行,对我们不花一分钱。我们收费的是在我们这边运行的部分:整理、翻译、朗读和智能体。

按年便宜 20%

Free

先试试

$0每月
开始使用
语音输入
80k
自动补全
80k
智能体
300k
设备
3
人数
1

Plus

整天都在写

$5.99每月
选择
语音输入
无限制
自动补全
无限制
智能体
1000k
设备
3
人数
1

Pro

又写又交办

$12.99每月
选择
语音输入
无限制
自动补全
无限制
智能体
无限制
设备
5
人数
1

Ultra

我们有好几个人

$39.99每月
选择
语音输入
无限制
自动补全
无限制
智能体
无限制
设备
10
人数
5

额度与账单一同在每月一号重置。

常见问题

下载前用户常问的问题

Midri Voice 是一款 Windows 语音助手。按住按键说话,文本即可直接输入到您当前的窗口中。您也可以直接与它对话,它会以语音回答、打开应用程序并整理您的文件。

预览版期间完全免费。目前网站不收取任何费用,也无需绑定银行卡。

是的。通过 Google 一键登录,无需创建或记忆密码。账户用于关联付费方案及使用配额。

听写在您的设备本地完成,音频不会上传。语音对话则不同:您的语音需要通过服务传输,否则无法为您提供回复。

目前支持 Windows 10 和 Windows 11。其他系统即将推出--助手本身并不绑定于 Windows。

任何带有文本框的窗口:Cursor、VS Code、JetBrains、终端、Telegram、Slack、Gmail、Notion 或浏览器。它会记住您开始说话前点击的文本框,即使窗口移动,文字也会准确输入到该位置。

自带听写功能仅记录声音。而 Midri 能理解您的意图:它会自动添加标点、去除冗余词汇、保留代码和名称格式、实时翻译,并能记住您之前提到的内容。

立即尝试,比读完此页面更快

您的语音在本地计算机上进行识别。账户主要用于云端处理功能:智能处理、翻译、语音朗读及助手服务。

Windows 11 · 预览版期间免费