Ahogrammer

Deep Dive Into NLP, ML and Cloud

2025-10-01から1ヶ月間の記事一覧

Text Embeddings InferenceをBlackwell GPUで動かす

Hugging Faceが提供するText Embeddings Inferenceは、テキスト埋め込みモデルで高速な推論を提供するためのツール。久しぶりに使おうとしたところ、執筆時点では手元のBlackwellアーキテクチャのGPUには正式対応していないことに気がついた。幸い、プルリク…

Gemini APIの構成的関数呼び出しでマルチホップQAを試す

Gemini APIのドキュメントを読んでいたところ、「構成的関数呼び出し(compositional function calling)」という機能があることに気がついた。この機能を使うと、LLMが関数を順番に呼び出しながら、段階的に複雑な要求を処理できる。たとえば「現在地の気温…

Deep Research用MCPサーバーの構築と独自データへの対応

2025年2月のリリース以来、Deep ResearchはChatGPTユーザーの間で広く利用されるようになった。私自身、6月ごろにLangGraphを使って独自に実装もしたが、その後の6月26日、OpenAIからDeep Research専用のモデル(o3-deep-research / o4-mini-deep-research)…

LLMによる文書解析の性能を比較したリーダーボード

文書解析といえば、Azure Document IntelligenceやMarkItDown、Doclingなどが広く使われている。近年ではマルチモーダルLLMの登場によって、これまでOCRや専用エンジンに頼っていた処理もLLMで実現できるようになりつつある。以前はプロプライエタリなモデル…

軽量な画像分類器を用いた業務画像の分類

文書の解析をするためのPythonパッケージであるDoclingのドキュメントを何気なく眺めていたら、Picture classificationなる機能があることに気がついた。どうやら、文書中の画像を以下のカテゴリに分類できるようだ。 棒グラフ(bar_chart) バーコード(bar…