-
AIトレーニング・LLM評価による日本語モデル品質改善
■プロジェクトの目的
日本語LLMの出力品質を評価し、モデルの学習と改善に反映すること。
■体制・人数
複数プラットフォームでの個人契約。ガイドライン担当者との連携あり。
■自分のポジション・役割
日本語評価者として、テキストおよび音声の出力評価、レビュー、改善提案を担当。
■目的を達成する上での課題
評価基準のブレを抑えること、日本語特有の自然さや敬語の適切さを判定すること、失敗パターンを再現可能な形で言語化すること。
■課題に対して取り組んだこと
指示遵守、事実性、推論品質、安全性、日本語自然性の観点でルーブリック採点と選好評価を実施。敵対的テスト、思考過程の検証、文字起こしの精度確認、音声合成の自然性・イントネーション評価を担当。体系的な問題は英語で根拠を添えて報告し、ガイドライン改善案を提示。
■ビジネス上の成果
評価で得た失敗パターンやコストと精度のトレードオフを、自社のモデル選定、プロンプト設計、ルーティング設計へ反映。AI開発の品質保証に直結させています。LLM評価、ルーブリック採点、選好評価、敵対的テスト、プロンプト設計、音声品質評価
-
AI業務システム・AIエージェント開発
■プロジェクトの目的
企業・店舗向けのAI業務システム、AIエージェント、業務自動化システムを設計・開発。
■体制・人数
5名(代表・開発)
■自分のポジション・役割
要件定義、設計、開発、テスト、導入、運用まで担当。
■目的を達成する上での課題
既存業務との連携、自動化、運用負荷の削減。
■課題に対して取り組んだこと
Python・JavaScript・Next.js・Supabase・AI APIを用いて、RAG、AIエージェント、管理システム、予約・通知自動化を実装。
■ビジネス上の成果
AI業務システム、AIエージェント、RAG、管理システムなど複数プロジェクトを設計・開発し、現在も継続して機能拡張・改善を実施。
Python、JavaScript、Next.js、Supabase、AI、RAG、API連携