SageMaker Processingでカスタムイメージを使ってデータを加工する

SageMaker Processingは、データの前処理や後処理、特徴エンジニアリング、モデルの評価といった機械学習のワークロードをSageMaker上で実行するための機能です。SageMaker Processingを使うことで、これらの処理をするためのジョブをコンテナ上で実行するこ…

2020-09-29

benchmark関数を使ってデータセットの処理時間の計測と改善に取り組む

TensorFlow TensorFlow Datasets

TensorFlowには、tf.data.Dataset APIという入力のパイプラインを実現するための強力な機能があります。入力のパイプラインを最適化することで学習全体を高速化できるため、定量的に計測して改善する価値があります。そこで、本記事ではTensorFlow Datasets…

2020-09-26

Wikipediaの前処理はもうやめて「Wiki-40B」を使う

TensorFlow 自然言語処理 TensorFlow Datasets

最近の自然言語処理では、大規模なテキストから単語の分散表現や言語モデルを学習させて使っています。学習する際のテキストとしては、分量や利用しやすさの都合からWikipediaが選ばれることが多いですが、その前処理は意外と面倒で時間のかかる作業です。そ…

2020-09-24

【TensorFlow】StringLookupの使い方

TensorFlow

以下のTweetで紹介したTensorFlow Recommendersのコードを見ていたら、StringLookupクラスという見慣れぬクラスを使っていました。あまり紹介している記事を見たことがないので、Tipsとしてどのようなものか紹介します。 TensorFlowで推薦システムを構築する…

2020-09-20

GiNZAで解析した依存構造を文節単位で可視化する

自然言語処理 GiNZA 構文解析

自然言語処理において、依存構造解析は多くのアプリケーションに役立つ重要な技術の1つでしょう。たとえば、テキストからさまざまな情報を抽出するシステムやアスペクトベースの評判解析、含意関係認識といった幅広いタスクで役立ちます。日本語で依存構造を…

2020-09-18

Universal Sentence Encoderをチューニングして多言語のテキスト分類

TensorFlow TensorFlow Hub 文書分類自然言語処理

「Googleが開発した多言語の埋め込みモデル「LaBSE」を使って多言語のテキスト分類」と題した記事を書いたところ、「Universal Sentence Encoder（以下、USE）と比べてどうなのか？」というコメントを見かけました。そこで、本記事では、多言語の埋め込み表…

2020-09-16

Googleが開発した多言語の埋め込みモデル「LaBSE」を使って多言語のテキスト分類

TensorFlow 自然言語処理文書分類 TensorFlow Hub

自然言語処理において、テキストをその意味を考慮しつつ固定長のベクトルに変換する埋め込みモデルは重要です。文の意味をよく表現したベクトルを作ることができれば、テキスト分類や情報検索、文類似度など、さまざまなタスクで役立ちます。本記事では、Goo…

2020-06-29

Lambdaレイヤーを公開するためのシェルスクリプト

AWS

最近、AWS Lambdaをよく使っているが、その機能の一つとしてLambdaレイヤーがある。レイヤーにパッケージを取り込むことで、複数のLambda関数から使用可能になる。ビジネスロジックを共通化する、ビルドの手間を省く等の恩恵があるが、私的にはデプロイする…

2020-06-27

質問応答におけるパッセージ検索 BERT vs BM25

情報検索論文紹介

最近、文章を書く機会が少なくなっているので、リハビリがてら以下の論文を紹介しよう。 Investigating the Successes and Failures of BERT for Passage Re-Ranking この論文は、BERTによるパッセージ検索がBM25と比べて、どのような状況で強いのか分析して…

2020-06-25