最近、AIへの指示出しでタイピングよりも音声入力のほうが楽で、これからのオフィス設計も変わっていくのでは、というような投稿を見ました。で、それについて入力インタフェースが課題ですよね、という夢の物語に繋がっていました。
音声入出力の特性
それ自体について特に何か反駁があるわけではないのですが、ただ思ったのは、僕自身はどうあってもキーボードによるテキスト入力と画面のテキスト出力を好むだろう、ということです。指が動くこと、使えること、目が使えること、という身体的な制約を加味すれば、耳と口という視覚とは異なるオーディオインタフェースについての価値は確かにあります。しかしそれは身体的な事情のためなのであって、効率のためではありません。
対人間であれば、発話からくる情緒的なニュアンスや、互いの時空間を拘束する同期的な性質により、コミュニケーションとしてメールより電話より対話が適していることはたくさんあります。しかしこれも本来の情報伝達という機能からするとやや本質的ではなく、対AIではほぼ無効化されるでしょう。せいぜいdBの値から発話者の感情の推測が働く程度ではないでしょうか。となると、この面でも効率的とは思えない。
出力帯域幅の観点では、これは確かに発話がタイピングより優れています。僕はかなりタイピング速度が早いほうだと思いますが、それでも音声にかなうはずはありません。しかし、多くの場合ボトルネックは帯域幅ではなく思考をまとめる脳の演算ではないでしょうか。
もちろん現場での作業中など咄嗟の一声と脊髄的な応答が必要な場面では違いますが、AIを使う時点でリアルタイム性については既に犠牲になっているでしょうし、またそもそもAIにできることと現場作業はかなり乖離があるのが現実に思います。とすると、実態としてはAIには咄嗟の応答ではなく論理的な応答が期待されるはずで、するとやはりボトルネックは我々の脳にあるのではないでしょうか。話す速度やタイピング速度は早く出来るかもしれませんが、早く考えることはできません。
一点、タイピングの明確な問題として視覚表現が苦手というのがあるのですけれど、これは発話もまったく同じ脆弱性を抱えているため、まぁこれについてはどっちもどっち、ですかね。むしろ記号やアスキーアートのような一発技がある分タイピングのほうがまだ有利ですかね。発話にもイントネーションや発声の大きさ・速度、ボイスパーカッションで表現という大技があるかもしれませんが、ちょっと厳しそう。
こういう感じなので、僕としてはそもそも対AIにおける音声入力の優位性自体にかなり疑問があります。
認知特性の話
…などと申し上げましたが、これを反駁という気がないのは、これらは僕の思考様式、認知特性が色濃く出たもので、この感覚は恐らく特殊なほうなのだろうと思われるからです。
つまり僕は、認知特性として極端に文字列に偏ってしまっているのです。これは僕が14年にわたってブログを続けられていることの一因でもあるでしょうね。
その結果なのか、それとも原因なのか、僕は基本的には一度ロジックを組み立てようとする癖がついています。それをしないと、理解が著しく妨げられるような感覚です。入出力の両方でそうなっており、素のまま受け止める、というようなことが苦手です。なので人の話を聞くのも正直苦手です。
昔からそうで、学校の授業では先生の言うことをその場で理解できませんでした。なので、後で教科書やノートを見直して、頭の中で整理して、ああそういうことか、と理解していました。幸いこれは成績を高める学習スタイルの一つとして有用なものであったので、その点では困らなかったのですけれど、頭のいい人は授業中に全部理解するのだ、というような言説を見聞きするたびに、そうなのかなぁ…とそれができない自分にもどかしさを感じることもありました。
なので、対人コミュニケーションで特に早口でまくし立てるような人とは非常に相性が悪く、それに対する自分なりのスタンスを築くにはまだまだ幼かったため、なかなか臆病な子供に育ってしまったと思います。認知特性を理解して対処法を教えられる人はなかなかいないですよね。今はさすがに経験を積んで、ある程度の対策は取りますが、やはり得意ではありません。
娯楽においてすら、音声や動画といった、盛んに次世代メディア的な喧伝をされているものも、あまり好きではありません。映画・ドラマ・アニメを見ません。小説・漫画を好みます。
一方、世の中YouTubeやTikTokが持て囃され、これからは動画だと言われ続け、今実際そうなっているでしょう。ショート動画は個人的には何がしたいのか意味不明なのですが、社会問題として受け止められることもあるくらいには好む人が多いようです。XことTwitterが最後のテキストメディアだという言説もよく聞きました。
このような感じですから、僕のほうが変わっているのでしょう。そしてこのご時世にこの(比較的)長文の記事を読まれている方も、恐らく世間的にはマイノリティに入る特性があるかと思われます。しかもその特性を多様とは認めてもらえません…おっと余計なことを言ってしまった。
出力インタフェースの期待
以上より、AIがあったからといってその入力に音声を使うことは、僕はあまりないのではないかと思います。ごくシンプルなタスクなどであればそういう特性の人はマイノリティかもしれませんが相当数はいると思います。自分の特性に確信があるならば、世間の潮流に流されないように振る舞いたいところです。
個人的には、出力を音から文字列に変換する、というロールのほうに、期待していますね。こっちのほうがAIも得意でしょ、多分。
コメント