Geminiの音声入力で勝手に回答が出るときは推論機能をオフにする

AI活用法

MacでGeminiの音声入力を使っていると、こちらただ入力したいだけなのに、AIが気を利かせすぎて(?)勝手に回答を生成することがあります。これが地味にストレス。でもご安心ください。この現象は、Geminiの設定画面から「推論機能」をオフにするだけで、あっさり解決できます。これで、途中で入力を遮られるイライラから解放され、自分のペースでゆったりと音声入力を使えるようになりますよ。

音声入力でGeminiが勝手に返事をしてしまう原因の追求

音声入力中にGeminiが返答してしまう最大の原因は、Gemini内部で動作している「自動推論」です。これ、例えるなら「めちゃくちゃ頭は良いんだけど、絶望的に空気が読めない人」との会話にそっくりなんですよね。こちらが言葉を詰まらせたり、ちょっと間を置いたりしただけで、「あ、この人はきっとこれを言いたいんだな!」と勝手に予測して、結論を急かしてくる感じです。AI側は良かれと思って文脈を判断しているのですが、入力している側からすれば「言われたことだけやってよ」と言いたくなってしまいます。

単に文章を入力したい場合でも、文章中に質問っぽい表現が含まれると、AIが気を効かせて回答を作成してしまうのがトラブルの真相です。

自動推論を無効化する設定手順

途中で勝手に回答が出力される現象を防ぐには、設定メニューから推論機能を無効にします。この設定を行うと、話した内容がそのままテキストとして入力欄に残るようになります。

具体的な手順は以下の通りです。(自動化で作ったものなので、なんか微妙なところもありますが、今回の手順はこれだけで十分理解できると思いますので、カスタムせずにそのまま貼ってます。)

操作マニュアル

操作マニュアル

STEP 1: 設定メニューの表示
Step 1
Geminiアプリの設定画面を開きます。左側のサイドバーから各種メニューにアクセスでき、初期状態では「メニューバーに表示」や「ログイン時に開く」といった基本設定が表示されていることを確認します。
STEP 2: Speak to Window 設定の構成
Step 2
サイドバーメニューから「Speak to Window」をクリックして選択します。音声入力を開始するためのショートカットキー設定や、AIによる推論機能のオン/オフ切り替えが可能な設定パネルを表示します。

設定を変えるのはこれだけ。たったこれだけのことですが、変更した後の「あ、もう勝手に喋り出さないんだ」という安心感と解放感はなかなかのものです。どれだけ長文をのんびり喋っても、こちらが送信ボタンを押すまでAIは静かに待機してくれます。これでようやく、AIに気兼ねすることなく自分の思考をじっくりと声に出せるようになりました。

以前作って存在を忘れていたアプリを引っ張り出してみた

ちなみに、今回この記事に載せているマニュアル画像ですが、実は以前に自分で開発した自作アプリを使って作成しました。画面収録した動画を放り込むだけで、AIが「ここが重要だな」という手順を自動で見つけ出し、綺麗に画像として切り出してくれるという優れものです。開発当時は「これでマニュアル作成が爆速になるぞ!」と鼻息荒くコードを書いていた記憶があるのですが、いざ完成して一通り動くことが確認できると、なぜか急に満足してしまいまして…。気づけばアプリの存在すら忘れ、ハードディスクの肥やしになっていました。人間、目的を達成するよりも「作る過程」そのものが一番楽しかったりしますよね。

実はこのアプリ、完成させた時点ですっかり満足してしまい、お腹いっぱいになって存在自体を忘れていました。今回「そういえば昔あんなのを作ったな」と思い出して使ってみたところ、マニュアル作成の手間が劇的に減りました。

今の私のデスク周りには、そうやって作りかけで放置されたガジェットや、書きかけのメモ、中途半端にカスタマイズされたキーボードなんかが散乱しています。そんなカオスな環境の中で、ふと「そういえば昔、あんなのを作ったな」と思い出して引っ張り出してきたのが今回のアプリです。久々に使ってみたら、当時の自分の工夫が随所に感じられて、マニュアル作成の手間が劇的に減ることを再確認しました。過去の自分に感謝ですね。このマニュアル作成アプリがどんな仕組みで動いているのか、他にどんな機能があるのかについては、また別の機会に(忘れないうちに!)詳しく紹介したいなと思っています。

おまけの話

この自動マニュアル作成ソフトは、Geminiのキャンバス機能で作ってあって、ここで使われているGemini APIはその時だけ利用されるもので、個人のアカウントに左右されないので、基本的にはどういう状態で誰が使っても使えるものになってます。

画像に関しては、切り取られたスクリーンショットではなく、AIが「ここの場所が必要だ」と判断した部分のシーンをBASE64でテキストベースで書いてあるものなので、画像を直接コントロールすることは非常に困難な状態になっています。

タイトルとURLをコピーしました