コールセンターの応対品質を安定させる要因は、評価基準の精緻さよりも、評価できている通話の割合が重要です。
しかし評価者が耳で聞ける通話数には上限があり、多くのセンターでは全通話の数パーセントを抽出して評価しています。
本記事では、応対品質の評価が成立する前提条件、全通話を文字起こしすると評価できるようになる範囲、自動評価では判定できない領域、そして自社が全件評価に移行すべきかを判定する軸を示します。
株式会社ストラーツの「電話応対AIサービス」は、通話の文字起こしと有人転送を組み合わせ、評価対象を全件に広げる構成に対応しています。
1.コールセンターの応対品質とは?評価する範囲と基本的な考え方

コールセンターの品質は、顧客が電話をかけてから用件を解決するまでの過程を、応対品質・接続品質・処理品質に分けて捉えることができます。
(1)応対品質・接続品質・処理品質の違い
コールセンターの品質は、次の3つに分けて扱います。これらは独立しておらず、接続品質の低下が応対品質の評価を押し下げるといった連動が起こります。
| 区分 | 評価する対象 | 主な指標 |
|---|---|---|
| 接続品質 | 顧客が話し始めるまでの過程 | 応答率、平均待ち時間、放棄呼率 |
| 応対品質 | オペレーターと顧客のやり取りそのもの | 言葉遣い、声のトーン、話す速度、共感的な姿勢 |
| 処理品質 | 用件が解決したかどうか | 一次解決率、回答の正確性、引き継ぎ時の情報連携 |
本記事で扱う応対品質は、この中で最も評価者の主観が入りやすい領域です。接続品質と処理品質はシステムのログから自動集計できますが、応対品質は通話の中身を人が確認しないと点数がつきません。ここが評価件数の制約を生みます。
(2)応対品質を正しく評価するための3つの条件
応対品質の評価は、次の3条件が揃ってはじめて改善につながります。1つでも欠けると、評価作業は実施されていても品質は動きません。
| 条件 | 概要 |
|---|---|
| 評価基準が言語化されていること | 「保留前に保留の理由と想定時間を伝えます」のように、聞き手が同じ判定を下せる粒度まで分解する |
| 評価対象の母数が偏っていないこと | 評価者が選びやすい通話(短い通話、担当が固定されたオペレーター)に抽出が偏ると、評価結果は実態とずれる |
| フィードバックの経路があること | 評価から本人への伝達までの期間が長いほど、本人の記憶が薄れて指導の効果が落ちる |
多くのセンターで整備が進んでいるのは1つ目です。詰まりやすいのは2つ目と3つ目で、いずれも評価者の工数が制約になっています。
2.コールセンターの応対品質を全通話から評価する方法

コールセンターの応対品質の把握には、評価対象となる通話の範囲を広げる方法があります。
(1)まずは現在の評価カバー率を把握する
自社の評価カバー率は、次の計算で概算できます。
評価カバー率=評価した通話件数 ÷ 月間の全通話件数 × 100
オペレーター20名が1人あたり月200件の着信を処理している場合、月間の通話件数は4,000件です。
品質管理担当者が1名で、1件の評価に通話確認と評価記入を合わせて15分かかり、月40時間を評価業務に使えるとします。この場合、評価できる通話は月160件です。
160件 ÷ 4,000件 × 100=4.0%
つまり、月間4,000件の通話のうち、実際に評価できているのは4.0%となります。
評価できる件数は、品質管理担当者が評価に使える時間によって限られます。そのため、通話件数が増えても評価に使える時間が変わらなければ、全通話に占める評価対象の割合は低くなります。クレームや解約の申し出など、確認したい通話が評価対象に含まれない可能性もあります。
(2)文字起こしで自動集計できる応対品質の項目
通話を全件テキスト化すると、これまで人が聞いて判定していた項目のうち、語句の有無や時間で判定できるものが自動集計に移ります。
| 項目 | 判定方法 |
|---|---|
| 名乗りと復唱の実施 | 定型フレーズの有無を検出する |
| 保留の回数と累計時間 | 通話ログと突き合わせる |
| 顧客の発話比率 | 話者分離後の発話時間を比較する |
| 沈黙の発生箇所 | 無音区間の位置と長さを抽出する |
| 言い直しの発生 | 同一内容の再発話を検出する |
| NGワードの使用 | 事前登録した語句と照合します |
これらは全件を対象にできるため、オペレーター単位の傾向と時間帯別・用件別の傾向まで比較できます。評価者の工数は、抽出と一次判定から、外れ値の通話を聞き込む作業へ移ります。
(3)応対品質と一次解決率などの指標を紐付ける
文字起こしデータを通話ログと突き合わせると、応対品質の各項目と一次解決率の関係を確認できます。
「保留が3回以上発生した通話は再入電率が高い」といった関係が見つかれば、指導する項目に優先順位をつけられます。CESは、顧客が用件を片付けるためにかけた労力を測る指標として提唱されたもので、保留回数や転送回数はこの労力に直接影響します。
なおストラーツの「電話応対AIサービス」は、録音資産や既存の番号を維持したまま、テキスト化の範囲を広げることが可能です。デモ体験から実際の応対品質をご確認いただけます。

体験手順とご注意 ※クリックで表示します
このデモ体験では、商品名による会話の分岐、名前・電話番号の聞き取り、途中で別の話題を振った場合の応答をご確認いただけます。
お電話いただくと「ご希望の商品」をお尋ねします。以下いずれかの商品名をお答えください。
「リフレアシロップ」/「アクティオールカプセル」/「レスタミンクリーム」
- 周囲の雑音が多い環境では認識精度が下がる場合があります
- 有人オペレーターへの転送はデモに含まれません
- 会話が途中で停止する場合があります
3.コールセンターの応対品質を自動評価するときの限界と注意点

評価の母数を広げても、自動化できる範囲には境界があります。ここを把握しないまま導入すると、システムは稼働しているのに評価者の工数が減らない状態になります。
なお以下の記事では、コールセンターのAI導入に関するデメリットを解説しています。

(1)音声認識の誤りによって評価がずれるケース
文字起こしの精度は、通話内容の性質によって変動します。特に次の情報は誤認識が起こりやすい領域です。
- 氏名、住所、地名などの固有名詞
- 型番、注文番号、英数字の混在した文字列
- 業界固有の専門用語、社内の略称
- 顧客側の環境音が大きい通話(屋外、車内、店頭)
- 早口、方言、複数人の同時発話
業務で頻出する固有名詞と型番は、辞書登録で補正します。辞書登録の対象は、過去の通話ログから出現頻度順に抽出すると効率的です。自動判定はスコアの確定に使わず、聞き込む通話を絞り込む一次フィルタとして使います。最終評価は人が担う設計にしてください。
(2)自動スコアリングでは評価しにくい項目
テキスト化されたデータから判定できるのは、語句の有無、時間、順序です。次の項目は、テキストだけでは判定が困難です。
| 評価項目 | 自動判定の可否 | 理由 |
|---|---|---|
| 名乗り・復唱の実施 | 可能 | 定型句の有無で判定 |
| 保留の告知 | 可能 | 発話の有無と順序で判定 |
| 声のトーンと抑揚 | 困難 | テキストに情報が残らない |
| 間の取り方 | 部分的に可能 | 適切さの判断が不可能 |
| 共感的な姿勢 | 困難 | 同じ言葉でも言い方で 受け取られ方が変わる |
| 説明のわかりやすさ | 困難 | 顧客の理解度は 発話量だけでは測れない |
| 怒りの収束 | 困難 | 感情分析は傾向の把握に留まる |
自動判定できる基本動作は全件で機械的に集計し、人による評価は上記の「困難」に分類した項目に限定します。
評価者1名あたりが聞き込む件数は増やさず、どの通話を聞くかの選び方を変えます。これにより工数を据え置いたまま、問題のある通話を捕捉できる確率を上げる設計が可能となります。
あわせて、自動判定で低評価となった通話の受け皿を確定させます。
判定結果をそのまま個人の指導対象にすると、誤認識による誤判定を拾います。判定に閾値を設け、閾値を下回った通話は品質管理担当者の聞き込みへ回す、という切り分けを設計時に決めます。閾値の見直しをシステム提供側が担うのか社内で行うのかも、あわせて確認します。
(3)評価データを増やしても改善につながらないケース
全件評価の導入で最も多い停滞は、フィードバックの詰まりです。次の条件では、評価件数を増やしても品質は動きません。
- 評価結果を伝える面談の時間が確保されていない
- 指導する項目が多すぎて、オペレーターが何から直すか判断できない
- 評価者ごとに判定基準がずれており、指摘内容が一貫しない
- 評価が人事考課に直結しており、指摘が防衛反応を招いている
評価件数を増やす前に、フィードバックの処理能力を先に決めます。
1人あたり月1回15分の面談を上限とするなら、伝える指摘は2項目までに絞ります。残りの評価データは、個人指導ではなくマニュアルとFAQの改訂に回します。評価と考課を分離し、評価データは育成目的に限定する運用も有効です。
(4)全件評価で発生するコストと運用工数
全件評価を導入する際は、システム利用料の総額および、運用に必要な作業やデータ管理にかかる工数も確認します。
| 辞書登録と調整の工数 | 業務固有の用語を登録する初期作業と、その後の追加登録が継続的に発生する |
|---|---|
| 評価シートの再設計 | 既存のシートは人が聞く前提で作られているため、自動判定項目と人手項目の分離が必要 |
| 録音データの保管容量 | 全件をテキスト化する場合、音声とテキストの両方を保管する期間を決める必要がある |
| 個人情報の取り扱い規程の改定 | テキスト化したデータの保管場所、アクセス権限、保存期間の定めが必要になる |
| オペレーターへの説明 | 全通話が評価対象になることの周知を省略すると、監視されているという認識される場合がある |
導入前に、どの作業を社内で行い、どこまでをシステム提供側が対応するのかを整理しておく必要があります。
特に辞書登録と調整は、担当者を社内に置くか提供側が継続して担うかで、必要な工数が大きく変わります。
4.コールセンターの応対品質を全件評価すべきか判断する方法
全通話を対象に応対品質を評価する方法が、すべてのコールセンターに適しているとは限りません。通話件数や現在の評価カバー率、問い合わせ内容、品質管理担当者の体制、既存システムとの連携状況によって、全件評価を優先すべきかは異なります。
以下のチェックリストでは、現在の評価体制、自動判定できる項目、人による確認が必要な項目、導入後の改善運用などの多様な観点からコールセンターの応対品質を全件評価すべきかご確認いただけます。

チェック結果を踏まえ、ここからは全件評価を検討する際の判断基準と、移行を優先しなくてもよいケースを整理します。
(1)4つの判断基準をもとに全件評価を検討する

①月間の通話件数
月間4,000件をひとつの目安として確認します。
月間4,000件を超え、現在のカバー率が数パーセント台にとどまっている場合は、文字起こしと自動判定で評価対象を広げる方法を検討します。通話件数が増えても評価者の工数は自動的には増えないため、そのままではカバー率が下がり続けます。
一方、通話件数が少なく、現在の運用でも一定割合を確認できている場合は、抽出方法の見直しを優先します。評価者が選びやすい通話に抽出が偏っていないかを確認するほうが、母数を広げるより効果が出ます。
②問い合わせ内容の定型度
用件の上位5種類で全体の6割以上を占める場合は、名乗り、復唱、案内フレーズなど、自動判定の対象となる定型表現を設計できます。問い合わせ内容が幅広い場合は、すべての通話を対象にせず、件数の多い用件から段階的に広げます。
なお、1件あたりの通話時間が平均30分を超える場合は、テキスト量が増えて確認箇所の特定に時間がかかります。用件単位で通話を分割して記録する運用を先に検討してください。以下の記事ではコールセンターのテキストマイニングについて詳しく解説しています。

③品質管理担当者の体制
全件評価では、データを集めるだけでなく、評価結果を確認して改善につなげる担当者が必要です。品質管理の専任者がいるか、兼務の場合は月に何時間を評価と改善活動に使えるかを確認します。
評価結果を確認する時間が確保できない場合は、評価対象だけを増やしても、フィードバックや改善施策まで進められません。月10時間を下回る体制では、集計作業が増える可能性が高まります。
④既存システムとの連携可否
録音装置、CTI、CRMなど、現在利用しているシステムの構成を確認します。録音データや通話ログを外部システムへ連携できる場合は、既存設備を残したまま必要な機能を追加できます。既存設備の入れ替えが必要になる場合は、導入範囲と必要な予算が変わります。
(2)全件評価への移行を優先しなくてもよいケースに該当しないか確認する

次のような場合は、全件評価よりも先に別の課題へ対応します。
①顧客が電話につながりにくい場合
放棄呼率や待ち時間など、接続品質に課題がある場合は、応対内容を詳しく評価する前に、顧客がオペレーターと話せる状態を整える必要があります。この場合は、呼量の削減や受付体制の見直しを先に行います。
②現在の評価方法でも応対状況を把握できている場合
在籍するオペレーターが10名未満で、評価者が全員の応対傾向を把握できている場合は、全件評価へ移行する必要性が低くなります。評価の母数を広げるより、評価基準を評価者間で揃えるほうが効果が期待できます。
③評価結果を改善に反映する仕組みがない場合
評価結果を取得しても、研修やフィードバック、マニュアル改訂などへ反映する仕組みがなければ、データを蓄積するだけになります。まずは、評価結果をどのように改善へつなげるかを決めます。
(3)検討対象となるシステムのタイプ
全件評価への移行を決めた場合、検討対象となるシステムは次の4タイプに整理できます。これを自社の状況との適合で選びます。
| タイプ | 適合する状況 | 留意点 |
|---|---|---|
| 音声解析・品質可視化に特化 | 既存の応対体制を維持したまま、評価の母数だけを広げたい | 既存のCTI・録音装置との連携可否を確認 |
| CRM統合型のプラットフォーム | 複数チャネルの問い合わせを一元管理したい | 既存システムからの移行範囲が大きくなりやすい |
| 自動応答と文字起こしの組み合わせ | 呼量そのものを減らしながら、残る有人対応の品質も把握したい | 自動応答のシナリオ設計と、有人転送の切り替え条件の設計が必要 |
| 個社対応でカスタマイズする構成 | 業務固有の用語や、既存の基幹システムとの連携要件が多い | 導入後の改修を誰が担うかを、 契約段階で確認する |
いずれのタイプでも、既存設備を残したまま前段に置く構成が可能かどうかが、投資判断の規模を左右します。既存のCTIや録音装置の入れ替えが前提になる製品と、連携で済む製品とでは、必要な予算と期間が変わります。
5.コールセンターにおける応対品質評価の導入で失敗しないポイント

ここでは、既存環境の確認から評価シートの見直し、全件評価への移行までの流れを整理します。
(1)既存のCTI・録音データ・連携環境を確認する
まず、現在利用している録音装置やCTI、CRM、基幹システムから、応対品質の評価に必要なデータを取得できるか確認します。確認する項目は次のとおりです。
| 確認項目 | 確認する内容 |
|---|---|
| 録音データ | 現在の録音データがどの形式で保存され、外部システムへ連携できるか |
| 話者分離 | 顧客とオペレーターの発話を分けて取得・判定できる録音方式になっているか |
| 通話ログとの紐付け | 着信時刻、保留、転送、通話時間などのログと録音データを同じ通話として紐付けられるか |
| テキストデータの保管 | 文字起こししたデータの保管場所、アクセス権限、保存期間をどのように管理するか |
| 既存システムとの連携 | CTI、CRM、基幹システムなどから、どの情報を参照・登録するか |
保留時間や転送回数を応対品質の評価に利用する場合は、文字起こしデータだけでなく、通話ログとの紐付けも必要です。顧客とオペレーターの発話比率を確認する場合は、それぞれの発話を分けて取得できるかも確認します。
また、全通話を文字起こしする場合は、音声データに加えてテキストデータも扱います。個人情報を含むデータについて、誰が閲覧できるのか、どこに保存するのか、どの程度の期間保管するのかを事前に決めます。
既存システムとの連携範囲も明確にします。録音データを受け取って文字起こしだけを行うのか、評価結果をCRMなどへ反映するのかによって、必要な連携範囲が変わります。
(2)応対品質の評価シートを再設計する
既存システムを確認したら、現在使用している評価シートを見直します。
従来の評価シートは、人が実際に通話を聞いて採点することを前提としているため、そのまますべてを自動判定に置き換えるのではなく、「システムで判定する項目」と「人が確認する項目」に分けます。分類例は次のとおりです。
| 分類 | 評価項目の例 | 判定者 | 評価する範囲 |
|---|---|---|---|
| A:自動判定 | 名乗り、復唱、保留の告知、NGワード、保留時間 | システム | 全通話 |
| A:自動集計 | 顧客発話比率、沈黙時間、通話時間、転送回数 | システム | 全通話 |
| B:人による評価 | 声のトーン、話す速度、間の取り方 | 品質管理担当者 | 自動判定で確認が必要となった通話 |
| B:人による評価 | 共感的な姿勢、説明のわかりやすさ、代替案の提示 | 品質管理担当者 | 自動判定で確認が必要となった通話 |
| C:定期抽出 | A・Bを含む応対全体 | 品質管理担当者 | 各オペレーターから一定数を抽出 |
このように分類すると自動化できる項目は全件で集計し、人による評価が必要な通話や項目へ品質管理担当者の時間を配分できます。
(3)全件評価へ段階的に移行する手順
全件評価へ移行する場合は、現在の評価方法を整理したうえで、対象範囲を段階的に広げます。
①現在の評価状況を把握する
最初に、現在どの程度の通話を評価できているかを確認します。月間の全通話件数と実際に評価している件数から評価カバー率を算出し、あわせて現在の評価シートを見直します。各評価項目について、以下のように整理します。
- 何を確認して判定しているか
- 評価者によって判定が変わる項目がないか
- 自動判定できる項目と、人が確認すべき項目のどちらに該当するか
「丁寧に対応する」といった評価者によって判断が変わる基準は、実際の発話や行動をもとに判定できる形へ整理します。
②対象を限定して文字起こしと自動判定を試す
次に、特定の問い合わせ内容や時間帯など、対象を限定して文字起こしを行います。この段階では、実際の通話で以下の内容を確認します。
- 正しく文字起こしできない業務固有の用語
- 氏名や地名、型番など誤認識が発生する語句
- 自動判定できる評価項目
- 人による確認を残す必要がある評価項目
誤認識される業務用語などが見つかった場合は辞書へ登録し、認識結果を調整します。
③自動判定する評価項目を確定する
試行結果をもとに、全件で自動判定する項目を決めます。
名乗りや復唱、保留の告知など、一定の条件で判定できる項目は自動判定へ移します。一方、正しく判定できない項目や、声のトーン、説明のわかりやすさなど人の判断が必要な項目は、人による評価に残します。
④対象を全通話へ広げる
試行した評価方法で運用できることを確認したら、文字起こしや自動判定の対象を全通話へ広げます。同時に、取得した評価結果をどのように改善へつなげるかも決めます。
個人ごとの評価結果はオペレーターへのフィードバックに利用し、複数の通話で同じ問題が確認された場合は、マニュアルやFAQの見直しに利用する形です。
全件評価では、評価できる通話件数そのものが増えるため、評価結果を誰が確認し、どこまで個人指導へ反映するのかも事前に決めます。
また、導入時には、辞書登録や認識精度の調整、評価項目の設定などを誰が担当するのかも確認します。システム提供側へ依頼する場合は、シナリオ修正や辞書登録の対応範囲、回数上限、対応期間などを確認しておきます。
6.まとめ
コールセンターの応対品質を左右するのは、評価基準の精緻さよりも、評価できている通話の割合が重要です。
まず自社のカバー率を算出し、4つの軸で全件評価に移行すべきかを判定してください。
株式会社ストラーツの「電話応対AIサービス」は、導入後の辞書登録、シナリオ修正を担当エンジニアが行うことが可能です。現在、社数限定で開発協力によるフルカスタマイズ無料キャンペーンを実施しています。発生する費用は基幹システム連携費用のみです。
応対品質の管理は、評価の母数の偏りをなくし、限られたフィードバック工数を最も効く箇所に配分する取り組みです。自社のカバー率と体制を踏まえた進め方についてお悩みの場合には、ぜひご相談ください。


