2018年9月16日日曜日

スクリーンリーダーとリンクにまつわるあれこれ


今回もスクリーンリーダー使いの立場から、Webアクセシビリティのお話を軽く。
お題は「リンク」問題。

ハイパーリンクはWebのもっとも特徴的な機能の一つ。リンクは一般的に、テキスト中でのカラー変更やアンダーライン、メニューやアイコン、イメージといった要素で視覚的に明示されている。
だが音声を手掛かりにWebbbを探索するスクリーンリーダーユーザーにとっては、リンクを自由自在に扱うにはさまざまな問題が発生する。
そこで、スクリーンリーダー使いの筆者が、最近個人的にちょっと感じたリンクに関するアレコレについて書いて見たい。


「リンク地獄」。そして、地獄から生還する方法


何はともあれ、以下の記事を見ていただきたい。


この記事の本文にある、おびただしいリンク攻撃。
この記事に限らず、ニコニコニュースのオリジナル記事はこういう、とにかく細かく用語ページへリンクが張られているパターンが多いため、芸風というか、そういう編集方針で掲載されていると想像できる。
是非はともかく、というか筆者的にはこのしつこいくらいの徹底ぶりは嫌いではないのだが、デフォルト設定でスクリーンリーダーを使っているユーザーにとっては、この記事はまさに「リンク地獄」以外の表現しか見つからない。
というのも、スクリーンリーダーでWebを読み上げていく道中、リンクを発見すると、初期設定ではアンカーテキストとともに「リンク」と読み上げ、その位置にリンクが存在していることを知らせてくれる。これは、うっかりリンクを見逃してしまうミスを防いでくれる親切設計なのだが、この記事のような本文中にリンクが頻出する記事では、「リンク」という報告音声も頻出してしまい、内容を理解する妨げになってしまう。下手すると、本文よりも「リンク」と読まれた文字数の方が多いなんてことにもなりかねない。

気持ち的には本文中のリンクは程々に……とお願いもしたくなるが、スクリーンリーダーの設定で、このリンク報告を止めることができるので設定方法を記載しておこう。

・iOS(11.4.1)
1.設定を開き、「一般」>「アクセシビリティ」とタップ。
2.「Voiceover」>「詳細度」>「埋め込みリンク」とタップ。
3.「読み上げる」以外に設定する。

・macOS(10.13.6)
1.「VO + F8」を押してVoiceoverユーティリティを開く。
2.カテゴリから「詳細度」を選び「テキスト」タブを洗濯。
3.「リンク/添付ファイルが存在するとき」の設定を「読み上げる」以外に設定する。

・NVDA(2018.2.1jp)
1.「NVDAキー + Control + D」を押して「書式とドキュメント情報」を開く。
2.「要素」グループにある「リンク」のチェックを外す。またはAlt + Kをおす。

これでリンク要素の報告がされなくなる。
もちろん本文だけでなく全てのリンクでこの設定が有効になるため、リンクの場所がわかりにくくなってしまう弊害もある。
音声のトーン変更やサウンドで報告したり、要素ジャンプ機能でナビゲートすることもできるので、聞きやすさと利便性のバランスを考えつつ設定しよう。


アンカーにURLってどうなんだろう…


例えばこんな例。

「HONDA NSX」を忠実に再現 ワイヤレスマウス | ニコニコニュース

またニコニコニュースさんを例にしてしまって申し訳ないが、あくまでも例なので。
このように、URLをアンカーテキストにしているリンクがいまだに結構見られるのだけれど、この長いURLも、スクリーンリーダー使いを苛立たせる要因の一つなのである。
筆者は記事の本文を冒頭から連続読みさせ、ハンズフリーで読むスタイルなのだが、途中で冗長なURLが読み上げられると、それまでの内容が一気に吹っ飛んでしまう。URLそのものには情報が含まれないためだ。ページに1~2箇所くらいなら我慢してスキップさせるが、頻繁に遭遇すると、なかなかのストレスである。晴眼者にとってはURLはサクッと読み飛ばせるが、スクリーンリーダーはそうもいかない。生真面目に記号とアルファベットの羅列を延々と読み上げ続けてしまう。

リンクを張らずにURLを記載する場合は別として、あえてURLをアンカーにする必要は少ないように思うのだけれど、そのあたりのセオリーはよくわからない。
アンカーテキストにはページタイトルが望ましいし、どうしてもURLを明記するのであればならドメインレベルで止めていただきたいというのが、いちスクリーンリーダー使いの本音だ……。

とはいえ、、URLがアンカーになっていないと騙しリンクが不安……という声もあるかもしれない。だが、そもそもリンク先とアンカーテキストが同一であるという保証はないわけで、どちらかといえば、怪しいリンクやページに遭遇したら、こまめに現在アクセスしているURLを調べるクセを身につける方が安全なのではないだろうか。

macOSのVoiceoverなら、リンクにVOカーソルを合わせて「VO + Shift + U」コマンドで、クリックする前にリンク先のURLを調べることができる。
  • また各種Webブラウザで、Macなら「Command + L」、Windowsなら「Control + L」もしくは「Alt + D」「F6」でアドレスバーに移動して、現在アクセスしているアドレスを調べられる。
スマートフォンやタブレットなら、アドレスバーへVoiceoverやTalkbackカーソルを移動させるか、直接タップして調べれば良い。


細かい話で恐縮しつつ。


あと最近は減ってはいるものの、音声だけではリンク先が広告なのか判別できなかったり、イメージがアンカーになっている場合に代替テキストが設定されておらずリンク先の情報が得られないなど、リンクにまつわるバリアはまだまだ多い。
スクリーンリーダー側でも外部リンクの通知などの対応が必要かも知れない。

とにかく、リンクはセキュリティにも直結する要素。

視覚障害者の情報生活をより快適かつ安全にするためにも、もっと議論されるべきテーマかもなと思うのだった。

2018年9月14日金曜日

代替テキストについて、漠然かつ不完全な考察



先日Twitterを眺めていたら、このようなエントリーが流れてきた。


とても共感と興味を抱かせる記事である。それとともに、日常的にWebから情報を得ている視覚障害者として、画像の代替テキストにどう向き合っているのかを、いっちょ考えてみようかと思ったりもしたのであった。

Webアクセシビリティで重要な要素と言われている「代替テキスト(Altテキスト)」。
HTMLタグでいうところの「<IMG SRC=‘画像ファイル名’ ALT=‘代替テキスト’>」ってやつである。代替テキストの機能や意味などについては調べていただくとして(例えばここやここなどが参考になるかも)、ほぼ全盲、スクリーンリーダー使いの筆者の立場で代替テキストについて、つらつら書いて見タイと思う。
なおここではスクリーンリーダー使いの一人としての個人的な見解を示すもので、一般的なセオリーとは外れているかもしれないが、その辺りは適当に流していただきたい。


現状と視覚障害者にとって代替テキストの持つ意味


正直なところ、Webを読んでいて代替テキストで画像の情報がしっかり伝割ってくると感じるケースは、かなり少ない。まず第一に、
・代替テキストが省略され、画像ファイル名を聞かされる
・代替テキストが空やブランクで「イメージ」としか読まない
・記事タイトルなど画像の説明になっていない内容で埋められている
……といったページが今だに、圧倒的に多い。

そもそもスクリーンリーダー使いにとって、代替テキストはどのような意味を持つのか。それは、晴眼者がWebを読むとき、イメージがコンテンツに与える影響と原則的には変わりない。
美しい風景写真が掲載された旅行記なら、そのようなイメージを思い浮かべて記事を読み癒されたりするし、クールなガジェットの紹介記事も、スタイリッシュな新製品を手にしている自分を思い浮かべながら記事を読みたいのである。
それはイメージを目で見るのと、説明文を音声を通じて聞き、脳内にイメージを展開させるだけの差でしかない。
すべてのイメージが失われたWeb記事を想像してみて欲しい。それはとても味気ないものだ。スクリーンリーダー使いにとって、代替テキストが用意されていない記事は、とても退屈だ。
もちろんテキストだけで心を動かされる記事もたくさんあるのはいうまでもない。あ、筆者のブログのことでは決して無い。

大前提として勘違いして欲しくないのは、視覚障害者は、そのイメージの「正解」を求めているのではない。そもそもそのようなことは無理だし、正解を確認する手段は皆無だ。
知りたいのは、その記事が何を伝えようとしているか。そのメッセージを余すことなく受け取りたい。他の読者と体験を共有したいのだ。


説明すべきイメージを乱暴に分類してみる


代替テキストについて考えるにあたり、Webで扱われるイメージを、乱暴ではあるが3種類に分類してみた。もちろん、あくまでも筆者の独断と偏見によるものであることをお断りしておく。

1.意味を持たないイメージ
2.見れば意味が伝わるイメージ
3.みただけでは説明不足なイメージ

以下、それぞれのイメージについて、どのような代替テキストがベターなのかをぼんやり考えてみたい。

1.意味を持たないイメージ

罫線や飾りボタンなど、情報を持たないイメージ。これはセオリーとしてALTを空にするよう推奨されている。
個人的には、そもそもこのようなイメージはあまり入れて欲しくないのだが。

また、主に記事の冒頭にアイキャッチ的に使われるイメージで、ストックフォトからの写真やロゴマークなどの本文とは直接的に関連性が低いものも、意味を持たないイメージと考えている。
正直スクリーンリーダー使いには混乱の元になる。「これはイメージ画像です」みたいな代替テキストを入れておいてほしい。

2.見れば意味が伝わるイメージ

人物や風景など、見た目一発で情報が伝わるイメージ。
メニューや共有ボタンのイメージなどもこれに含まれるだろう。

ボタン類は別として、記事中にあるイメージで、本文やキャプションで説明すると「くどい」感じになるもの、要するに晴眼者にしてみれば「見ればわかるし。」的な説明は、代替テキストでの説明が効果的だしアクセシブルと言える。

例えばインタビューの記事では、たいていインタビュー対象者の写真やインタビュー中の様子が掲載されている。このような場合、どのような代替テキストが入っているとわかりやすいか。もちろん筆者の個人的な印象であるが。

これが「男性の写真」や、セオリーとも言える「肩書きと名前」だと、あまりイメージはわかない。特に肩書きは記事本文で記載されることが多いため、代替テキストとしては余分な情報に感じてしまう。
ではイメージが膨らむ情報とは?
それはその人物の佇まいの説明ではないかと思う。例えば「スーツ姿でチェックのネクタイ、黒縁の眼鏡」や「デニムに黒のニット、明るいカラーのロングヘアー」など、その人物の写真から得られる特徴を説明してくれると、以後のインタビュー記事で、どのような人物が話しているかを想像することができ、記事の内容に膨らみが生まれてくる。ちょっとした情報でも、有るのとないのとでは、記事の印象は大きく変化する。
もちろんこのような説明は最初の写真だけに含まれればよく、以降は名前に加え表情など記事の流れに即した説明がされていれば良い。

この手法は、ラジオ番組ではよく用いられる。ゲストを呼ぶコーナーでプロフィール紹介をした後に、その人物の服装や特徴をふんわりと説明すれば、リスナーは、以後その人物を思い浮かべながら放送を楽しめる。テレビならみればわかる情報も、ラジオではあえて説明することでイメージが膨らむのである。ましてやWebは「声」という手がかりも無い訳で、画像の説明はより重要となってくる。

もちろん、何でもかんでも説明すれば良いというわけではない。背景の壁紙の模様やテーブルに乗っている飲み物の種類、窓から見える風景など、記事と関連性の無いものの説明はむしろノイズにもなりうる。繰り返すが、視覚障害者は写真の正解は求めていない。

もう一つ付け加えるなら、イメージを脳内再生するにあたり、それがどのような種類のイメージなのかを説明することも重要ではないかと思う。
「写真」なのか「イラスト」なのか、それとも「スクリーンショット」? 「表」や「グラフ」など。
同じ猫のイメージでも、写真とイラストでは、印象は大きく変わってくるからだ。

3.みただけでは説明不足なイメージ

被写体そのものを説明するのではなく、ある状況を切り取ったイメージは、一見しただけでは意味が伝わりにくい。たとえばイベントのステージ写真や、PCやスマホのスクリーンショット、ガジェットのギミックを説明する写真などは、イメージだけでは意味が伝わりにくい。写真のどこに注目すべきなのか判別しにくいためだ。
Web記事ではこのようなイメージの説明を本文中に入れ込む場合が多いが、その内容をイメージの代替テキストに入れてしまうと、本文と代替テキストで同じ文章が繰り返し読まれ、非常にわかりにくくなる。

解決策の一つとして考えられるのは、本文での説明を簡略化して、イメージの意味伝達をキャプションで行う手法だろう。イメージにキャプションが添えられていれば、視覚障害者、晴眼者にかかわらず意味が的確に伝わりやすくなる。
もちろん先述のように本文と代替テキストが被るといった現象も軽減するだろう。本文とキャプションが被っていたら、一般読者にもくどい記事になるからだ。

キャプションを使う場合のイメージの代替テキストは、可能であれば前項(2.)に即していれるのが望ましいが、「○○イベントのステージ写真」「設定画面のスクリーンショット」「○○ガジェットの製品写真」のようなシンプルな表記の方が、場合によっては理解しやす苦なるかもしれない。
要するに、代替テキストで「何が写っているのか」を、キャプションで「写っているものの状況」を説明する感じだ。

今の所、Web記事を読んでいて、イメージの情報が的確に伝わってくるのは、やはりキャプションを使用したものが多い印象を持っている。


まとまらなかったが、まとめ。


どうも、思いつくまま代替テキストについて書いたが、まとまらなくなってしまった。もう眠い。
スクリーンリーダー使いの一人として、どのようなコンテンツが理想的なのだろう。考えれば考えるほどわからなくなってくる。
どこまで細かく説明すべきか、表やグラフなどの説明はどうあるべきか、抽象的なイメージは? など、イメージをテキストで説明するのは非常に難しい問題だ。
スクリーンリーダーのユーザーでも年齢層や、視覚障害を持った時期によっても代替テキストから受け取る情報は異なるはずだ。

一つ言えるとしたら、代替テキストは、ただ「ALT=」に何かを入れればアクセ渋るになるものではなく、むしろ情報をいかに伝えるかといったコンテンツ制作側のセンスによって、その効果が大きく左右されるもののような気がする。
そう考えると、一筋縄ではいかないジャンルであることだけはわかった。

冒頭でも述べたが、現状では、的確な(もしくは情報を伝える意思を感じる)代替テキストは、まだまだ少ない。
より良い代替テキストとは何か? コンテンツ提供サイドに頼るだけでなく、スクリーンリーダー使いの立場からも、常に考えながらWebと接していく必要があるのかもしれない。
今後は機械学習による自動テキスト付与などの技術も普及しつつあり、そちらとの兼ね合いも注目だ。

視覚障害者の脳内に、Webの豊かな世界が少しでも多く注ぎ込まれますように。

2018年9月13日木曜日

iPhone発表会の全盲的インプレッション


毎年9月のお祭り、アップルのiPhone発表会が今年も開催された。事前には新しいiPadやMacのラインナップが一新されるのでは、といった噂が飛び交ったが、蓋を開けてみると、iPhone XS / XRとApple Watch 4で打ち止めという結果に。
iPhoneについては、リークされていた情報から大きく外れず、2モデル3機種の発表となったが、いろいろな意味で今後のiPhoneの流れを示唆する内容だった。
詳しいスペックや価格などはIT/ガジェットニュースで山ほど報告されているのでそちらに譲るとして、視覚障害者(ほぼ全盲(のiPhoneユーザーの視点から、いくつかキーワードを挙げて雑感を綴って見る。

パフォーマンスと表現力


2018年版iPhoneには、最新プロセッサ「A12 Bionic」が採用されており、処理性能の向上が期待できる。具体的なパフォーマンスは発売後のベンチマーク結果を待たなければならないが、性能は良いに越したことはないだろう。
視覚障害者的にはOCRや物体検出などの画像解析に代表されるAI分野のアプリを利用することが多いため、性能はきになるポイントだ。現状ではさほど不便を感じることは無いが、今後ハイエンド端末を前提とした画期的なアプリが出現しないとも限らない。しないかもしれないけど。

またXS seriesにはSuper Retinaディスプレイが採用され、デュアルカメラによる撮影昨日も強化されているが、視覚障害者でこのポイントを重視するユーザーはそう多くはなさそう。AIを用いた撮影支援機能などが出現してくれると魅力的になるのだが、それはどちらかといえばソフトウェアの領域かもしれない。

風前の灯、ホームボタン


昨年のiPhone Xの登場ですでにホームボタンの消滅は予感されていたが、今年のイベントでホームボタン搭載iPhoneの新モデルが発表されなかったことで、この慣れ親しまれたボタンの運命は風前の灯となってしまった。
視覚障害者の間でも、ホームボタンの先行きに暗雲が立ち込めたことに悲嘆の声が上がっている。やはり物理ボタンの存在は安心感があるし、ホームボタンの触覚でiPhoneの裏表や上下位置を判別できるのは視覚障害者には重要なポイントだ。
ただiPhone Xの操作も慣れて仕舞えばさほど違和感は無いというユーザーも多く、Siriやアクセシビリティのショートカットなどは引き続きサイドボタンでの操作になるので、そこまで大きな障壁にはならないのではと考えている。

ただ個人的にはiPhone 7 / 8の振動フィードバックのホームボタンは、iPhoneの電源が入っているかを判断するのに便利だったので、そこは残念だ。

Touch IDとFace ID


ホームボタンよりも悩ましいのが、生体認証システムがFace IDになってしまう点だろう。iPhoneをしっかり見ることができない視覚障害者は、注視オプションを無効にして使用することになるが、この設定では寝ている顔でロック解除できる可能性が高くなるなどセキュリティ的な弊害が発生してしまう。
無論Touch IDでも寝てる間に指紋をスキャンされるリスクはあるが、Face IDは基本的に晴眼者の使用スタイルを前提に設計されているように思えてならない。

また筆者がそうなのだが、Voiceover使いは、結構フリースタイルでiPhoneを使う。
カバンやポケットにiPhoneを入れたまま、横になりつつiPhoneはお腹の上に置いたまま。そんな態勢でもTouch IDならiPhoneを動かさずにロックを解除し、そのままVoiceoverでiPhoneを操作できる。これに慣れてしまうと、いちいちロックを解除するためにiPhoneを顔の前に持って行くのが面倒に思える。

新iPhoneの「TrueDepth」カメラは機能が強化されているとのことで、どれだけ問題点が解消されているか興味ぶかいが、将来的にはTouch IDが併用できるようになることが望ましい。

意外だった3D Touchの扱い


何気に衝撃的だったのが、iPhone XRに「3D Touch」機能が搭載されないという事実。
これを、XRの価格を下げるための苦肉の策なのか、今後この機能をフェードアウトさせる予告なのかは判断できないが、これまで出来ていたことが出来なくなるのは、ちょっとApple大胆ですなという印象である。
まあ、登場からかなり経過するのに、あまり浸透していないのも事実なわけで、筆者も画面左端プッシュでApp Switcher起動するくらいにしか使っていない。

旧モデルの運命やいかに


新機種の発表に伴い、iPhone XとiPhone 6S、iPhone SEが販売終了隣、iPhone 7 / 8シリーズは値下げされ販売継続となる。
このサイクルで自然に考えると、iPhone 7は2019年、iPhone 8は2020年に終了するという計算になるが、果たしてどうなるのか。そもそも今後ホームボタン搭載のiPhoneは登場しないのか。知ってるのはAppleの中の人だけである。ただ新しいiOSが対応する限り現役、とも取る考え方もあるため、ホームボタン派も、まだしばらくは安泰と考えた方が精神衛生上よろしいかと。
むしろiPhone 7 / 8が値下げになることで、iPhoneに乗り換える視覚障害者にとっては悪いニュースでは無いかもしれない。

それにしても、docomoはWithラインナップにiPhone 6Sを追加したばかりなのに。この仕打ちは織り込み済みだったのか期になるところだ。

まとめ的ななにか


今回のiPhone発表会で思ったことを、いくつかポイントを挙げて書いてみた。
全体的な感想としては、目新しい技術は無いものの、明らかにラインナップの整理にかかっているように思える。今後はLightning端子やオーディオのワイヤレス化なども進められると予想されているが、視覚障害者的には、センサーや触覚の進化などに期待している。
例えば9軸モーションセンサーを使ったトラッキングや、GNSS、QZSSシステムに対応した位置情報取得、触覚ディスプレイや3Dバイブレーションなどが使えるようになれば、一気に夢が広がりそうなのだが。

スマートフォンの新製品というと、処理性能とカメラ、ディスプレイの進化がメインで面白みが無くなっている。そろそろ新しい何かが欲しいと思うのは、筆者だけだろうか。

2018年9月10日月曜日

タッチスクリーンの障壁を越える技術


現代社会はタッチパネルで溢れている。
銀行ATM、駅の切符売り場、牛丼屋、コンビニに入ればレジ横には確認用のタッチパネルが待ち構えているし、コピー機やチケットなどを扱う情報端末に至るまで、タッチパネルに遭遇しない方が難しい。あ、自動販売機でもタッチパネル式のものがあるな。最近では家電製品でもボタンではなくタッチパネルで操作するものも増えてきた。

しかしこのタッチパネルは視覚障害者との相性がすこぶる悪い。
確かにATMにはハンドセットで音声操作ができたり、点字が添えられた物理ボタンを併設している場合もあるが、端末のすべての機能をカバーしていない場合がほとんどで、不便なことこの上ない。例えばiOSのVoiceoverやAndroidのTalkbackのように、タップして読み上げ、ダブルタップで実行、といった操作に対応してくれればいいのだが、すでに普及している端末をアップデートするのは困難だしプライバシーの問題もある。結局現状では視覚障害者が一人でタッチパネル端末を使用するのは「ほぼ無理」と言わざるを得ない。

そのような悲しい現実を変えてくれるかもしれないデバイスが開発されている。
カナダ、ウォータールー大学で機械工学を学ぶCraig Loewenらが率いるチームが開発中の「WatVision」は、指に装着するリングとスマートフォンアプリを使用し、視覚障害者のタッチパネル操作を支援する。
大まかな操作方法は、

1.WatVisionアプリを起動して、スマホのカメラでタッチスクリーン全体が収まるように構える。この時アプリは、タッチパネルのエッジを検出し、音声でナビゲートする。
2.指にリングを装着し、タッチパネルの上にかざすと、その位置の文字を読み上げる。

つまりリングはトラッキングの役割を担い、アプリがリングの位置を検出して操作を支援する仕組みのようだ。厚みを持ったリングは3Dプリンターで出力され、指に装着してタッチパネルの上をスライドさせても誤動作しないような素材で製作されている。タッチしたいボタンが見つかったら、指を少し傾ければタッチ操作を実行できる。将来的には振動モーターをしようした触覚フィードバックの追加も計画されているようだ。

WatVisionはまだ開発まもないプロジェクトのため、画像を用いたボタンなどが認識できないなど多くの課題がある。だがタッチパネルの問題をつまびらかにし、実現可能なプロダクトとして公開したことは、視覚障害者にとっても大きな意味のあるプロジェクトだろう。
チームはアプリをオープンソースとしてGitHub上に公開。世界中の開発しゃにタッチパネルに潜む深刻な問題の解決を呼びかけている。

それにつけても、タッチパネルのアクセシビリティは、もう少しどうにかならないものか。音声対応は時間が掛かるとしても、色反転やコントラスト調節、拡大文字などは難しくないようにも思えるのだけれど。
不特定多数が利用する可能性のある端末だからこそ、障害者や高齢者にも配慮した製品が望まれている。

関連リンク:


2018年9月9日日曜日

MLBで開催される「Blind night」に注目。


野球観戦は、視覚障害者の間でも特に人気のあるスポーツだ。
シーズン中はラジオ中継を欠かさず放送しているし、守備と攻撃がはっきりしているルールは、音声だけでも状況を把握しやすい。ラジオ実況を聞きながら、脳内のスタジアムでは白熱したゲームが展開されるのである。
だが多くの野球ファンは、そのような視覚障害を持つ野球ファンのことをどれだけ知っているのだろうか?

米国の盲人連盟(NFB ~ National Federation of the Blind)と、MLB、アメリカンリーグ東地区に所属するボルチモア・オリオールズは、2018年9月18日、視覚障害について理解を深め、NFBの40周年を祝うためのイベントゲーム「Blind night」を開催する。
(対戦相手はトロント・ブルージェイズ)

ゲーム当日、選手は背中の名前と正面の「Orioles」を点字で印刷したユニフォームを着用。米国のプロスポーツでこのような試みは初めてのことだという。試合終了後、ユニフォームは選手のサインを添えてチャリティーオークションに出品される。
6つの点で文字を表現する点字がユニフォームになるのは、想像するだけでインパクトがあるし、エレガントだ。多分凹凸は無いとは思うが。

また15,000枚の点字アルファベットカードが観客に配布される他、盲人の歌手・ピアニストのCarlos Ibay氏が国歌斉唱を担当。NFB代表のMark Riccobono氏が始球式を務める。もちろん彼も視覚障害者であるため、どのようなピッチングを披露するのか注目だ。
これは想像だが、観客は手元の点字アルファベットカードを使って、選手のユニフォームに印刷された点字を解読する楽しみもあるのかもしれない。これは子供にも楽しい仕掛けでは無いだろうか(妄想)。

これらの模様しは、多くのMLBファンに視覚障害について関心を持ってもらうのと同時に、障害の有無にかかわらずスポーツを楽しむ素晴らしさを改めて共感するきっかけになるだろう。
筆者は環境が無いためチェックできないが、CSなどMLB中継を視聴できる環境があれば、もしかしたら日本からこのゲームを楽しめるかもしれない。

国内でもチャリティーイベントは開催されているが、ここまで規模の大きなものは聞いたことはないし、押し付けがましく無いスマートでユニークな演出は、さすが米国といった印象だ。
2020年のパラリンピック開催が迫る中、障害者への理解を深める手段として、こういうのもアリな気がしなくも無いのである。

関連リンク:


2018年9月4日火曜日

スマートグラスのニューウェーブ「AMAL Glasses」


AIによる画像認識技術の進歩により、視覚障害者の「目」の代わりとなるテクノロジーが続々と登場している。
このブログでも紹介したスマートフォンアプリ「Seiing AI」や「Envision AI」がその一例だが、これをもういっぽ進めたメガネ型ウェアラブル・デバイス「スマートグラス」は、視覚障害当事者の間でも大きな関心を集めているデバイスだ。
代表的なものには、イスラエルのスタートアップが開発した「Orcam My Eye」や、米国の遠隔支援サービス「AIRA」が採用している「Horizon」、日本でも文字認識に特化した「Oton Glass」などがある。

アラブ首長国連邦(UAE)、ドバイに本拠地を奥くMIH Systemsが現在開発を進めているスマートグラス「AMAL Glasses」は、そのような視覚障害者向けスマートグラスの中でもひときわユニークな存在だ。
AMAL Glassesは、軽量なサングラス型のウェアラブルデバイスと、ポケットに収まるコントローラーで構成され、これらはケーブルで接続される。グラスにはHD品質のカメラを搭載、高感度マイク、オンセイフィードバックを聞くためのスピーカー、GPSなどの各種センサーを内蔵する。
操作はグラスのテンプル(つる)のタッチジェスチャ。将来的には音声コマンドによる操作にも対応予定とのことだ。

ではAMAL Glassesではどのようなことができるのだろうか。
公式サイトでは、現時点で25もの機能が予告されている。
文字を読み上げるOCRや、色・紙幣・風景・人物などの認識といった定番の画像認識機能はもちろん、オーディオブックの再生やボイスレコーダー、リマインダー、さらに音声でプレイできるゲームまで用意されている。道に迷ったときに現在地を取得してヘルプを呼び出せる「SOS」機能も心強い。
中東発のプロダクトらしく、ムスリムのために、礼拝の時間をリマインドしたり、キブラの方角を知らせてくれる機能も用意されている。

機能をざっと見渡してみると、スマートグラスとスマートフォンが合体したような印象を感じる。いや、どちらかといえば画像認識もできるウェアラブルなスマートスピーカーというべきだろうか。
単なる文字や物体検出だけでなく、日常生活で役立つ機能を盛り込むことで、読書や買い物といった限定的なシーンだけでなく常に身につけて視覚障害者をサポートするデバイスを目指して開発されていると感じた。

AMAL Glasse最大の特徴は、アプリを追加インストールして機能を拡張できる「Application Store」だろう。無償配布予定のSDKを利用して誰でも視覚障害者のためのアプリを開発でき、専用のアプリストアから配布できるようになるとのことだ。
たとえば音声を使ったナビゲーションやAIRAのような遠隔サポート、画像や音声認識を活用したさまざまな用途が考えられる。もちろん、ゲームやスポーツ支援なども楽しそうだ。視覚障害者支援プラットホームとしての、スマートグラスの可能性を感じさせる。
同じ視覚障害を持っていても、個人のニーズは微妙に異なる。ユーザーのライフスタイルや行動範囲に合わせてカスタマイズしたり、就労や教育現場にマッチしたアプリケーションを開発することもできるだろう。

AMAL Glassesはアラビア語、英語など7言語に対応(日本語には非対応)。
早ければ2018年内にも出荷が開始される予定だ。

関連リンク:


2018年9月1日土曜日

もう一つの視覚障害者向け画像認識アプリ「Envision AI」


iPhoneが視覚障害者の「目」になる


視覚障害者の生活を支援するスマートフォンアプリは数多くリリースされているが、その中でもにわかに注目を集めているのが、AIと深層学習を応用し、画像に含まれる文字や物体、人物を解析して音声で読み上げてくれる画像認識アプリだ。
代表的なアプリとしては、マイクロソフトの「Seeing AI」やGoogleの「Google Lens」「Lookout(リリース予定)」などが挙げられるが、その中でもダークホース的な存在とも言えるのが、Envision Technologiesの「Envision AI」だ。
先日のアップデートで大幅な機能追加がアナウンスされたこともあり、ここで改めてこのアプリをじっくり使って見ることにした。
搭載されている各機能の使い勝手とともに、5月に当ブログでレビューした「Seeing AI」との比較なども行いたい。

○iOSアプリ
開発 Envision Technologies B.V.
価格 サブスクリプション制
評価バージョン v1.5.2
評価環境 iPhone 7 (iOS 11.4.1)

Envision AIの利用にはユーザー登録が必要。GoogleやFacebookアカウントが利用できる。インストールから14日間、全ての機能が無料で試せ、それ以降は一ヶ月あたり10回まで無料で利用可能。
サブスクリプション料金は、550円/月、2,800円/6ヶ月、4,500円/年、23,800円/無制限の4種類のコースが用意されている。
またAndroid版の開発も進行中だ。


Envision AIの機能と使い方


アプリを起動すると画面下部に4つのタブがあり、使いたい機能を選択する。
タブを開くと利用できる機能ボタンが表示されるので、ここからスキャン機能を有効にしたり、写真を撮影して画像認識できる。機能によってリアルタイムで認識するものと、写真を撮影してから認識するものがあり、リアルタイム機能はボタンがオン/オフの切り替えになっている点に注意。

「文字の認識」タブ

・すぐに読み上げを始める
iPhoneをかざした文字をリアルタイムに読み上げる機能。
日本語には対応していないが、英語ならかなり正確に認識して読み上げてくれる。さらに「ヘルプ」タブの設定でオフラインの認識をオンにすれば、認識のスピードがさらに向上する。

・手書き文字の読み上げ/文章の読み上げ
読み上げたい文字をカメラで撮影してから認識し、読み上げる機能。日本語の認識に対応している。こちらも認識精度は高い。
手書きに関しては手元に手書き原稿が見つからなかったので印刷物で認識させたが、日本語も認識できた。
認識したテキストは、エクスポートボタンから他アプリなどへ共有することもできる。

「周りの物の認識」タブ

・風景を説明する

カメラで撮影した風景を画像認識して説明してくれる。
認識精度はSeeing AIの「Scene preview」「と同程度だが、ちゃんと日本語で読み上げてくれるのでわかりやすい。説明は大雑把なのだが、何かしらの手がかりにはなるかもしれない。
また、撮影した写真を説明文付きでカメラロールへ保存することもできる。「写真」アプリで保存した写真を選ぶと、Envision AIで認識した説明が読み上げられるので、後日写真を確認するときに便利だ。

・色を検出する
リアルタイムで、iPhoneをかざした対象物の色を日本語で説明してくれる。
ただ若干タイムラグがあるようで、少しiPhoneをかざしたまま待たないと、正確な説明は得られないようだ。

・バーコードをスキャンする
商品パッケージに記載されているバーコードを検出し、内容を読み上げる。
Seeing AIのようにバーコードを自動で検出せず、バーコードが印刷されている面を撮影できるまで何度か撮影し直さなければならない。
試した範囲では、国内のコンビニで購入した日本製のお菓子のバーコードは「無効」とエラーが帰ってきたが、輸入品ショートブレッドのバーコードはスキャンが成功し、商品名などが読み上げられた。

「スキャンして見つける」タブ

・カスタムオブジェクトの認識
学習させた顔やオブジェクトをリアルタイムに認識させる。
ただ試した範囲では、学習がうまくできず、うまく動作させることができなかった。

・一般的なオブジェクトの認識
iPhoneをかざしたオブジェクトを認識し、リアルタイムで読み上げる(日本語)。
ただ、認識精度はあまり(というか、かなり)良くない。筆者の机上にあるキーボードやノートパソコンを認識させても、「楽器」「まくら」とかなりトンチンカンな答えが帰ってきた。内蔵AIの学習モデルが弱いのだろう。
顔を認識させようとしても「耳」「髪」とパーツで読み上げてしまい、Seeing AIの「Person」のように表情や性別などの認識は行ってくれない。

・Envisionに学習させる
オブジェクト認識の弱さを補うのが、カスタムでAIを学習させる機能。
正確に識別させたい人物の顔やオブジェクトの写真を撮影し、その写真を元にAIを学習させ「カスタムオブジェクトの認識」を使って認識させることができる。
「顔を学習させる」または「オブジェクトを学習させる」を選択し、識別させたい顔や物品を10回撮影。識別名を入力して学習させる。学習データは「ライブラリを開く」から管理できる。
ただ顔を学習させようとして「成功」と表示されても学習データが生成されていなかったり、学習が「処理中」で延々と終わらないなど、まだ動作が不安定な印象だ。
この機能については、後日改めて検証して見たい。

「ヘルプ」タブ

ここではチュートリアル(英語)が読めたり、読み上げスピーチの設定、色認識の詳細どなどの設定の他、アカウントやサブスクリプションの管理などが行える。


Seeing AIとの比較


Envision AIを使っていると、やはりどうしても「Seeing AI」と比較して見たくなるのが人情というもの。AIを活用した視覚障害者向け画像認識アプリというコンセプトは同じものでも、それぞれ特徴が見える。ざっくり並べて見ると、

・Envision AI
○インターフェイスや認識結果が日本語に対応
○リアルタイムのOCRが高速(英語のみ)
○ドキュメントの文字認識の精度も高い
○認識させた風景を説明文ごと保存できる
○エレガントな効果音。読み上げはVoiceoverとは別に設定できる
×オブジェクト認識が非力。AI学習が不安定

・Seeing AI
○全体的にUIがシンプルで直感的
○カメラのオートフレーミングが便利
○紙幣、明るさ、写真ライブラリの識別機能を搭載
○顔認識の学習が簡単で高速
×ドキュメント以外の読み上げが英語

・共通
×リアルタイムOCRは日本語に非対応
×日本のバーコードスキャンには非対応
×風景の認識精度は微妙

というかんじだろうか。
どちらもまだ精密に使い込んでいるわけではないので第一印象での比較であることを留意いただきたいが、やはり日本語で利用できるEnvision AIは親しみやすさを感じる。Seiing AIも、将来日本語化されるはず(たぶん…)なので、それまでにEnvision AIがどこまで独自性を打ち出せるかに注目したい。

それにしても、リアルタイムOCRやバーコードスキャンといった、ずっと欲しかった機能に限って日本語に非対応というのが残念。処理するデータ量が桁違いだとか日本の商品データベースが使えないなど諸問題はあるとは思うが、これは是非対応を望みたいところだ。


まとめ:風景解析とカスタム学習に勝ちを見いだせれば


視覚障害者の目となってくれる画像解析アプリは、AIの進歩とともに最も注目されるジャンルの一つだ。その中でもEnvision AIは、Seiing AIと並び、トップクラスの品質を持っているといっていいだろう。
Envision AIのキモは、風景認識と「スキャンして検索」がどれだけ実用的に使えるか。「風景を説明する」の精度や、カメラ代りに使える点、AIの学習機能を評価できれば、十分にこのアプリを使う意味はあるだろう。逆にこの部分に魅力をかんじないのであれば「OCR」や「色彩ヘルパー」といった無料アプリを使い分けてもさほど困らないかもしれない。個人的には将来性に期待し、開発を支援する意味でも購入を検討する魅力を持ったアプリだと思う。

話題的には「Seeing AI」の後塵を拝している雰囲気を感じる「Envision AI」だが、使って見ると勝るとも劣らない実力を持っている。

iPhone持ちの視覚障害者はもちろん、画像認識AIに興味があるなら、ぜひ一度体験して見てはいかがだろうか。

支援技術関連記事まとめ(2022年11月)※お知らせあり。

※以下のリンクをクリックするとDropboxへ接続し、ダウンロードが自動的に始まります。 ※ダウンロードファイルはHTML形式です。ブラウザで開いてください。 ※正常に表示されない場合は別のブラウザで試すか、エンコード設定を変えて見てくださ い。 ダウンロード: 海外記事 / 国...