四十年、私たちは記号で機械に説明してきました。 言葉で言ってください。

Windows のための音声入力、エージェント、自動補完。どのアプリの上でも。

普段お使いの環境でそのまま動作

CursorClaudeChatGPTCopilotVS CodeJetBrainsZedSlackTelegramWhatsAppGmailNotionObsidianDocsFigmaLinearChromeCursorClaudeChatGPTCopilotVS CodeJetBrainsZedSlackTelegramWhatsAppGmailNotionObsidianDocsFigmaLinearChrome

スピード

話すことはタイピングよりも速い。明らかに速いのです。

会話の速度は1分間に約150語です。タイピングは平均40語で、さらに修正の手間もかかります。

音声で150 wpm
キーボードで40 wpm

左側の時計は、音声、認識、フォーマット、挿入という、最初の画面で示された3つのフェーズすべてで動作します。このプログラムは、話している最中に下書きを表示することもありません。右側は、1分間に40語のペースでタイピングし、1箇所誤字がある状態です。

第2ステップ

書き起こしは誰にでもできます。違いはその後に何が起こるかです。

通常のディクテーションは、手作業で修正が必要な単語の羅列を提供します。Midri Voiceは、言い淀みや思考の終わり、不要な言葉を自動的に判別します。

聞いたまま

えーっと、第3四半期、いや第4四半期の売上レポートを見ました。

「3番目、いや4番目」といった自己修正を検知し、意図した内容のみをテキストに残します。

音声での対話

コマンドではなく、自然な会話を

話し終わるのを待たずに聞き取り、文字起こしを介さず直接音声で応答します。途中で遮ったり、聞き直したり、内容を変更することも可能です。

あなたSpotifyを開いて、落ち着いた曲をかけて

アシスタントSpotifyを開いています

あなた30分後に電話の件をリマインドして

アシスタント承知いたしました。この会話を開いている間、7時に通知します

話し終えてから最初の応答まで1.4秒

手足となるアシスタント

言うことが、そのまま実行になる

やりたいことを伝えるだけで、最大3つのワーカーが同時に処理を行います。権限は個別に付与され、デフォルトで有効なのは「画面の確認」のみです。

MidriMidri Voice

アシスタントの権限

アシスタントがこのコンピュータ上で実行可能な操作

これはお客様のコンピュータとファイルです。必要な機能のみを有効にしてください。権限はいつでも取り消せますが、実行済みの操作は元に戻せません。

確認頻度権限によって操作の可否が決まります。ここではアシスタントが確認を求める頻度を設定します。
常に確認する実行のみ許可し、不可逆的な操作で停止する確認しない
画面を表示スクリーンショットおよびウィンドウの内容。これをオフにすると、アシスタントは画面が見えない状態で回答します
プログラムの起動インストール済みのプログラムを開き、切り替えます
ファイルを操作しますファイルの読み取り、作成、変更、名前の変更を行います。削除したファイルはゴミ箱に移動します
コマンドを実行しますPowerShellコマンド。破壊的なコマンドはプログラム内でブロックされ、どのような権限でも実行されません
ブラウザを使用しますページを開き、読み取り、クリックします。実行環境独自のブラウザを使用し、お客様がログインしたアカウントで動作します。お客様のタブにはアクセスできません

あなたのもの

見た目は、あなたが決める

四つの形と七つの配色。選んでも、着替えを眺めていても。

形か色をタップ

それでも打つときは

文の半分は、もう頭の中にある

書きかけの続きを、こちらの窓ではなく、あなたが実際に書いている窓の上で差し出します。よければ Tab。違えばそのまま打ち続けてください。黙って消えます。

Slack
#team
A
Ann10:12
エクスポートジョブの修正を反映しました。処理が速くなるはずです。
M
Max10:15
ありがとうございます。夜間バッチを再実行して数値を確認します。
修正のあと夜間ビルドを回した。書き出しは11分ではなく4分で終わった。
1手が止まる
2続きを差し出す
3Tab で受け取る

コードとプロンプト

エディタにプロンプトを口述するだけで、専門用語もそのまま維持されます。

「use state」はuseStateに、「task dashboard」はTaskDashboardに変換されます。名称は発音と画面上で開いている内容から復元されます。

アシスタント
~/プロジェクト
アシスタント準備完了。タスクを説明してください。

Claude Sonnet

コード名は発音と画面上の情報から復元されます。

mainTypeScript7行目, 22列目
普段お使いの環境でそのまま動作CursorClaudeChatGPTCopilotVS CodeJetBrainsZed

話しながら翻訳

あなたの言語で話せば、相手の言語で入力されます。

翻訳は後からの別工程ではなく、キーを押す一連の流れに含まれます。25言語に対応しており、設定でターゲット言語を選択するだけです。

Slack
#team
D
Dana13:48
エクスポートジョブの修正を反映しました。処理が速くなるはずです。
I
Ivan13:55
ありがとうございます。夜間バッチを再実行して数値を確認します。
M
Mark14:02
プルリクエストを再度ご確認いただけますでしょうか?
ENこんにちは!修正ありがとうございます。すべて修正して再送しました。

挿入先: ES

メッセージ #team

他人のテキスト

選択して、自分の言語で読む

選択すると、自動的にバーが表示されます。翻訳カードには質問欄があり、音声または入力でテキストの内容やトーンについて質問できます。

Telegram
J
James
最近オンライン
今日
ステージング環境へのデプロイは完了しましたか?
18:54
はい、1時間前に完了しました。ログに異常はありません。
18:57
了解しました。一点だけ確認です。
19:03
移行が完了するまでリリースは保留中です。本番環境を壊すより、遅れてリリースする方がましですから。
19:12
メッセージ

テキストチャット

声を出せない時もある。それでも訊ける。

ショートカットキーで、作業中の画面の上に呼び出せます。音声アシスタントと記憶やツールを共有しており、思考プロセスをリアルタイムで表示するため、回答の生成中も先読みが可能です。

四半期報告書.docx

作業中、ブラウザタブを開いていない状態でも、切り替える必要はありません。

メモリ

単なる事実の羅列ではなく、ウェブ状の構造です。

通常のメモリは単語一致で検索されるファイルの行ですが、ここではリンクで構成されています。新しいノードは関連するノードを見つけ、呼び出し時にはリンクを辿って周辺情報まで引き出します。

MidriMidri Voice
会話メモリ
メモリを検索
マックスと呼ばれていますTypeScriptを記述火曜日のスタンドアップミーティ…プロジェクト「Storefro…第4四半期売上レポート簡潔な回答を好むタイムゾーン - モスクワ移行について質問Slackを使用
9 ノード·このコンピュータに保存すべて表示
150wpm

会話のペース

1.4

最後の言葉から音声回答まで

25言語

挿入時の翻訳言語

できること

10個のウィンドウを1つのアシスタントに

音声対話、アプリやファイルの操作、リマインダー、お客様に合わせた設定、そしてすべての始まりであるディクテーション機能。

アシスタント

話しかけたときの動作について。

10

テキストではなく音声で回答

話している最中から聞き取りを開始し、文字起こしを介さず直接音声で回答します。最初の反応まで約1.5秒です。

「Spotifyを開いて」で即座に起動

インストールされているすべてのアプリを認識し、名前で起動します。すでに起動しているアプリを指定した場合は、新しく開くのではなく、そのウィンドウを前面に表示します。

独自のブラウザでタブを占有しません

アシスタントは独自のプロファイルを持つ独立したChromiumを使用します。ページの読み込み、クリック、フォーム入力はそのブラウザ内でのみ行われます。必要なサイトへのログインは、そのブラウザ内で一度行うだけです。ブラウザは別途ダウンロードされます(ダウンロードサイズ:149MB、ディスク使用量:344MB)。

選べる30種類の音声

低く落ち着いた声、活発で軽快な声、柔らかくゆったりとした声。音声はオーブメニューや設定から変更できます。30種類のうち2種類は無料プランでも利用可能です。

あなたの視界を共有

画面を共有して、表示内容について質問できます。エラーの読み上げ、操作手順の案内、見慣れないウィンドウの解説などに対応します。

会話の中で音声リマインド

「30分後に教えて」と頼めば、会話ウィンドウが開いている限り、30分後に音声で通知します。通知バナーではなく、会話の流れの中で自然に伝えます。

ディクテーション

音声がテキストに変換される仕組みについて。

9

インターネットなしで動作

音声認識はPC内で完結します。接続が切れてもディクテーションは継続され、ルールに基づいてテキストが補正されます。音声データが外部に送信されることはありません。

独自の名称や専門用語

GitHub、macOS、Kubernetesなど、45種類の主要な用語は自動的に認識されます。それ以外の用語もリストに追加でき、音の響きに基づいてマッチングされます。

画面がヒントになる

アクティブウィンドウの名称が現在のフレーズの辞書に追加されます。「Slack」について話しているときは、そのまま「Slack」として認識されます。

任意のキーまたは組み合わせ

Right Alt、Caps Lock、Ctrl+Shiftなど、単一キーを含むあらゆる組み合わせが可能です。トランシーバーのように、話している間だけ押し続けてください。

独自のライティングルール

「ビジネス調」「感嘆符なし」「短文」など、ルールを言葉で指定し、すべてのフレーズに適用できます。

何も失われません

ディクテーションした内容はすべて手元に残り、ワンクリックで再貼り付けが可能です。データはコンピュータ内にのみ保存されます。

ローカル動作

使用していないときのプログラムの動作について。

4

9つのセクションで構成

ディクテーション、テキスト処理、チャット、Live AI、コネクタ、履歴、外観、システム、サブスクリプションの各項目があります。アシスタントの権限やAIモデルの設定は「Live AI」内に集約されています。テーマ、12色のアクセントカラー、ウィンドウの質感、パネルの配置場所もカスタマイズ可能です。

待機時はスリムな帯状

操作していないときは画面の端に細い帯として表示されます。マウスを合わせると展開し、マイク、会話、アシスタント、設定の各機能にアクセスできます。離れると再び収納されます。

独自のキーを利用可能

当社経由の支払いを希望されない場合は、OpenAI、Anthropic、GoogleなどのAPIキーを入力して、各社のモデルをMidriで利用できます。キーはWindows資格情報マネージャーに保存され、当社サーバーには送信されません。

常にサイドで動作

パネルはフォーカスを奪わず、作業画面の上に被さることもなく、カーソル位置も移動させません。ブラウザ操作の権限を許可し、実際にブラウザを使用する場合のみ、専用のウィンドウが開きます。

インストール

音声データはコンピュータから外に出ません

認識はローカルモデルで実行されるため、インターネット接続は不要で、データが外部に送信されることもありません。プログラムの使用にはアカウントが必要ですが、これはスマート処理、翻訳、読み上げ、アシスタントなど、サーバー側で実行される機能のために使用されます。

macOS

予定

準備中

Linux

予定

準備中

現在プログラムはクローズドベータ版であり、公開ビルドはまだありません。アカウントを作成していただければ、ビルドが利用可能になり次第ご連絡いたします。macOS版およびLinux版も予定していますが、開発はまだ開始されていません。

料金

あなたの機械が計算する分は無料。こちらのサーバーが計算する分は有料

認識はあなたの機械で走り、こちらには一円もかかりません。お金をいただくのは、こちらで走る分だけ - 整形、翻訳、音声、エージェントです。

年払いは20%お得

Free

まず試す

$0月あたり
はじめる
音声入力
80k
自動補完
80k
エージェント
300k
台数
3
人数
1

Plus

一日中書く

$5.99月あたり
選ぶ
音声入力
無制限
自動補完
無制限
エージェント
1000k
台数
3
人数
1

Pro

書いて、任せる

$12.99月あたり
選ぶ
音声入力
無制限
自動補完
無制限
エージェント
無制限
台数
5
人数
1

Ultra

何人かで使う

$39.99月あたり
選ぶ
音声入力
無制限
自動補完
無制限
エージェント
無制限
台数
10
人数
5

枠は請求と同じく毎月1日にリセットされます。

よくある質問

ダウンロード前によくある質問

Midri VoiceはWindows用の音声アシスタントです。キーを押しながら話すだけで、入力中のウィンドウに完成したテキストが挿入されます。また、話しかけることで音声による回答、アプリの起動、ファイルの整理を行うことも可能です。

プレビュー期間中は無料です。現在サイト上での決済はなく、クレジットカード情報の入力も求められません。

はい。Googleアカウントでワンクリックでサインインできるため、パスワードを作成したり忘れたりする心配はありません。アカウントは有料プランや利用制限の管理に使用されます。

ディクテーションはローカル環境で処理されるため、音声データが外部に送信されることはありません。一方、音声会話機能では、AIが応答を生成するために音声データがサービスを経由します。

現在はWindows 10およびWindows 11に対応しています。今後、他のOSにも順次対応予定です。アシスタント自体はWindowsに依存していません。

テキストフィールドがあるすべてのウィンドウで利用可能です。Cursor、VS Code、JetBrains、ターミナル、Telegram、Slack、Gmail、Notion、ブラウザなどに対応しています。話し始める前にクリックしたフィールドを記憶しているため、ウィンドウが移動してもテキストは正しく入力されます。

標準機能は音声をそのまま文字起こしするだけですが、Midriは文脈を理解します。句読点の自動挿入、フィラー(「えーと」など)の除去、コードや固有名詞の正確な保持、リアルタイム翻訳、そして過去の会話内容の記憶が可能です。

まずは試してみましょう。このページを読み終えるよりも早く体験できます

音声認識はPC内で行われます。アカウントは、スマート処理、翻訳、音声読み上げ、アシスタントなど、クラウド側で処理される機能のために使用されます。

Windows 11 · プレビュー期間中は無料