エントリー済み

待つ、諦める、やり直す。LLM非同期処理の回復性設計 〜不確実性を前提に考えた生成AI評価システム〜

初級者 Architecture Design

LLMの処理は、いつ終わるのか、必ず成功するのかをアプリケーション側から予測しにくいものです。
本講演では、SMCCで内製開発したAI生成テキストの品質・不適切表現評価システムを題材に、不確実なLLMをシステムに組み込むための「待つ・諦める・やり直す」非同期設計の考え方を紹介します

PoCではS3+Lambda+Bedrockによる非同期構成を採用し、評価結果をS3へ出力してポーリングで完了を確認していました。
一方で、処理に失敗した場合や一定時間結果が生成されない場合は、ユーザーが再実行するという割り切った運用となる課題がありました。

本番化では、変更頻度の高い評価用プロンプト管理をECS(FastAPI)へ、実行時間が読みにくいBedrock評価処理をLambdaへ分け、一定時間は待つ、結果がなければ失敗とみなす、必要に応じて自動再実行する、という振る舞いをアプリケーション側に取り込みました。

本セッションでは、この実例をもとに、待機時間、失敗判定、再実行単位、リトライ上限、ユーザーへ戻す条件をどう決めるかを、LLM非同期処理の設計指針として解説します。

Speaker

Kota Fukuchi

三井住友カード株式会社

クラウドエンジニア

三井住友カード株式会社 AI・データチャプターのクラウドインフラエンジニア。
当初はデータ領域志望だったが、インフラチーム配属を機にクラウド技術を猛勉強し、入社2年目の現在は部内のAWS運用・管理を全面的に任されている。
AIの理論的知見とインフラの実践力を併せ持つ強みを活かし、これまでにLLMを活用したアプリケーションを4件設計・開発。現在はIaC推進による運用高度化にも注力している。
「AIをインフラ目線で実装・運用する」リアルな知見を発信すべく、自社テックブログの執筆など継続的なアウトプットにも取り組む。
・SMCC初の内製開発への取り組み ~未経験の新卒が1年でアプリを作るまで~
・GitHub Actionsで社内Git研修を効率化する ―不揃いなログを自動判定させてみた―