Scoring Evasion: A Tradable Sentiment Signal from Earnings-Call Q&A
Оценка уклончивости: торгуемый сигнал тональности из Q&A отчётных звонков
We score the Q&A portion of 8,400 earnings calls across 200 US tickers (Jul 2019–Jun 2026) for hedging, uncertainty and evasion, fusing three lexicons with a finetuned transformer classifier and z-scoring each company against its own history. The resulting tone signal has a pooled next-day rank IC of 0.14 and sorts a decile long-short book with a 7.0 bps/day gross spread. After a 2.5 bps-per-side cost model that consumes about a third of the raw edge, the net strategy returns 11.6% annualized at a Sharpe of 1.44 and an 8.1% maximum drawdown, against 8.4% / 0.54 / 24.3% for buy-and-hold. The edge is small, persistent across every subperiod and sector, and — being small — capacity-constrained by design; we treat that honesty as the result, not a caveat.
Мы оцениваем часть Q&A 8 400 отчётных звонков по 200 американским тикерам (июль 2019 – июнь 2026) на хеджирование, неопределённость и уклончивость, объединяя три лексикона с дообученным трансформерным классификатором и z-нормализуя каждую компанию относительно её собственной истории. Итоговый сигнал тональности имеет объединённый ранговый IC следующего дня 0,14 и сортирует децильный лонг-шорт-портфель с валовым спредом 7,0 б.п./день. После модели издержек в 2,5 б.п. на сторону, забирающей около трети сырого преимущества, чистая стратегия приносит 11,6% годовых при Sharpe 1,44 и максимальной просадке 8,1%, против 8,4% / 0,54 / 24,3% у «купи и держи». Преимущество невелико, устойчиво в каждом подпериоде и секторе и — будучи малым — ограничено по ёмкости по своей природе; мы считаем эту честность результатом, а не оговоркой.
1 Introduction
1 Введение
The wager behind this work is narrow and testable: the unscripted portion of an earnings call — the analyst Q&A — is where information leaks, because it is the one segment management cannot fully rehearse. A tone score built on that segment is easy; a tone score that survives being turned into positions is not. We insist on three hurdles before calling anything a signal. First, the raw tone score is z-scored against each ticker's own history, so it captures a change in a management team's posture rather than the fact that some sectors simply sound more cautious than others. Second, the signal is graded out-of-sample via a decile sort, never on the window used to build it. Third, it must clear a transaction-cost model that removes roughly a third of the raw spread. A tone score is a demonstration; a cost-surviving backtest is a result.
Ставка этой работы узка и проверяема: неподготовленная часть отчётного звонка — Q&A с аналитиками — это место, где утекает информация, потому что это единственный сегмент, который менеджмент не может полностью отрепетировать. Оценку тональности по этому сегменту построить легко; оценку тональности, которая переживает превращение в позиции — нет. Мы настаиваем на трёх барьерах, прежде чем называть что-либо сигналом. Во-первых, сырая оценка тональности z-нормализуется относительно собственной истории каждого тикера, чтобы улавливать изменение позиции команды менеджмента, а не тот факт, что некоторые сектора просто звучат осторожнее других. Во-вторых, сигнал оценивается на отложенной выборке через сортировку по децилям, никогда — на окне, использованном для его построения. В-третьих, он должен пройти модель транзакционных издержек, которая убирает примерно треть сырого спреда. Оценка тональности — это демонстрация; бэктест, переживший издержки, — это результат.
2 Data — the transcript panel
2 Данные — панель транскриптов
The panel is 8,400 Q&A sessions across 200 US tickers over seven years (Jul 2019–Jun 2026), an unbalanced panel averaging roughly 1,200 scored calls per year as the covered universe grows from about 150 to 200 names. Coverage widens over time as transcript-vendor availability improves for smaller caps; we do not backfill names into periods where their transcripts were not available point-in-time.
Панель — это 8 400 сессий Q&A по 200 американским тикерам за семь лет (июль 2019 – июнь 2026), несбалансированная панель со средним около 1 200 оценённых звонков в год по мере роста охваченной вселенной примерно со 150 до 200 бумаг. Охват расширяется со временем по мере улучшения доступности транскриптов у поставщиков для компаний малой капитализации; мы не задним числом вносим бумаги в периоды, где их транскрипты не были доступны на момент времени.
2.1 Point-in-time timing
2.1 Тайминг на момент времени
Every transcript carries a close timestamp, and the tone signal is treated as known only after the call closes. Returns are measured next-day open-to-close, so there is no look-ahead from same-session prices bleeding into the score. This is the single most common way a text signal flatters itself, and the timing rule is enforced at the event level.
Каждый транскрипт несёт метку времени закрытия, и сигнал тональности считается известным только после завершения звонка. Доходность измеряется на следующий день от открытия до закрытия, поэтому нет заглядывания вперёд из-за просачивания цен той же сессии в оценку. Это самый распространённый способ, которым текстовый сигнал себе льстит, и правило тайминга применяется на уровне события.
2.2 The prepared / Q&A split
2.2 Разделение подготовленной части и Q&A
A rule-based section splitter isolates the analyst-question and management-answer turns from the prepared-remarks block. Only answers are scored. Prepared remarks are dropped entirely: they are lawyered, disclosed on a schedule and largely priced before the call ends.
Разделитель на основе правил вычленяет реплики вопросов аналитиков и ответов менеджмента из блока подготовленных заявлений. Оцениваются только ответы. Подготовленные заявления полностью отбрасываются: они выверены юристами, раскрываются по расписанию и в основном учтены в цене ещё до окончания звонка.
3 Linguistic construction
3 Лингвистическая конструкция
3.1 The lexicons
3.1 Лексиконы
Three lexicons run over each answer span: a hedging list ("roughly", "we believe", "too early to say"), an uncertainty list of Loughran-McDonald-style modal and uncertain terms, and an evasion measure built from topical divergence between the question and the answer — the degree to which management answers a different question than the one asked.
По каждому фрагменту ответа проходят три лексикона: список хеджирования («примерно», «мы полагаем», «пока рано говорить»), список неопределённости из модальных и неопределённых терминов в стиле Лафрана-Макдональда, и мера уклончивости, построенная на тематическом расхождении между вопросом и ответом — степень, в которой менеджмент отвечает на другой вопрос, а не на заданный.
3.2 The finetuned classifier
3.2 Дообученный классификатор
A small transformer is finetuned on approximately 4,000 hand-labeled answer spans graded on an evasive-to-forthcoming axis. It supplies a continuous tone score per answer that captures phrasing the fixed lexicons miss.
Небольшой трансформер дообучается примерно на 4 000 размеченных вручную фрагментах ответов, оценённых по оси от уклончивости к открытости. Он выдаёт непрерывную оценку тональности по каждому ответу, улавливая формулировки, которые пропускают фиксированные лексиконы.
3.3 Fusion and per-ticker z-scoring
3.3 Слияние и z-нормализация по тикеру
Lexicon and classifier scores are combined into a single call-level tone score, then z-scored against each ticker's own trailing history. This strips persistent cross-company tone bias: a chronically cautious CFO is not a permanent short, and a structurally upbeat management team is not a permanent long. The signal measures change relative to a company's own baseline.
Оценки лексикона и классификатора объединяются в единую оценку тональности на уровне звонка, а затем z-нормализуются относительно собственной предыдущей истории каждого тикера. Это устраняет устойчивое межкорпоративное смещение тональности: хронически осторожный финансовый директор — не вечный шорт, а структурно оптимистичная команда менеджмента — не вечный лонг. Сигнал измеряет изменение относительно собственной базовой линии компании.
4 Signal construction & ablation
4 Построение сигнала и абляция
To locate the source of the lift, we grade three configurations — lexicon-only, classifier-only, and the combined score — on rank IC, gross and net decile spread, and net Sharpe. The verdict in Table 1 is unambiguous: the classifier carries most of the signal, and the lexicons add interpretability plus a marginal +0.8 bps of net spread on top of the classifier alone.
Чтобы найти источник прироста, мы оцениваем три конфигурации — только лексикон, только классификатор и комбинированную оценку — по ранговому IC, валовому и чистому децильному спреду и чистому Sharpe. Вердикт в Таблице 1 однозначен: классификатор несёт бóльшую часть сигнала, а лексиконы добавляют интерпретируемость плюс маргинальные +0,8 б.п. чистого спреда поверх одного классификатора.
| Configuration | Конфигурация | Rank IC | Gross spread (bps/day) | Валовый спред (б.п./день) | Net spread (bps/day) | Чистый спред (б.п./день) | Net Sharpe |
|---|---|---|---|---|---|---|---|
| Lexicon-only | Только лексикон | 0.08 | 4.1 | 2.3 | 0.71 | ||
| Classifier-only | Только классификатор | 0.12 | 6.0 | 3.8 | 1.18 | ||
| Combined | Комбинация | 0.14 | 7.0 | 4.6 | 1.44 |
5 Signal quality
5 Качество сигнала
The pooled next-day rank IC is 0.14. On a trailing 6-month window it is positive in every window across the seven years and dips below trend only during the 2020 volatility shock, when the cross-sectional dispersion of tone briefly stopped mapping to returns. The per-decile response is near-monotone from D1 to D10, with mean signal rising from −1.55z to +1.58z and gross next-day return from 0.6 to 7.6 bps (Table 2). Subperiod stability is reported in Table 3.
Объединённый ранговый IC следующего дня равен 0,14. На скользящем 6-месячном окне он положителен в каждом окне на протяжении семи лет и опускается ниже тренда лишь во время шока волатильности 2020 года, когда поперечная дисперсия тональности на короткое время перестала отображаться в доходности. Отклик по децилям почти монотонен от D1 к D10, при этом средний сигнал растёт с −1,55z до +1,58z, а валовая доходность следующего дня — с 0,6 до 7,6 б.п. (Таблица 2). Стабильность по подпериодам приведена в Таблице 3.
| Decile | Дециль | n | Mean signal (z) | Средний сигнал (z) | Gross next-day (bps) | Валовая след. день (б.п.) | t-stat | Monthly hit % | Попадания в месяц, % |
|---|---|---|---|---|---|---|---|---|---|
| D1 | 840 | −1.55 | 0.6 | 0.5 | 48.7 | ||||
| D2 | 840 | −1.00 | 1.4 | 1.1 | 49.6 | ||||
| D3 | 840 | −0.66 | 1.9 | 1.6 | 50.3 | ||||
| D4 | 840 | −0.38 | 2.6 | 2.2 | 51.0 | ||||
| D5 | 840 | −0.13 | 3.4 | 2.9 | 51.8 | ||||
| D6 | 840 | 0.12 | 4.0 | 3.3 | 52.4 | ||||
| D7 | 840 | 0.37 | 4.9 | 3.9 | 53.1 | ||||
| D8 | 840 | 0.65 | 5.7 | 4.3 | 53.7 | ||||
| D9 | 840 | 1.01 | 6.9 | 4.6 | 54.2 | ||||
| D10 | 840 | 1.58 | 7.6 | 4.8 | 54.6 | ||||
| D10−D1 | 7.0 |
| Period | Период | Calls | Звонки | Rank IC | Net spread (bps/day) | Чистый спред (б.п./день) | Net Sharpe |
|---|---|---|---|---|---|---|---|
| 2019 H2–2020 | 2-е полугодие 2019 – 2020 | 1,850 | 0.11 | 3.9 | 1.02 | ||
| 2021 | 1,180 | 0.17 | 5.8 | 1.71 | |||
| 2022 | 1,210 | 0.15 | 5.1 | 1.49 | |||
| 2023 | 1,240 | 0.13 | 4.4 | 1.31 | |||
| 2024 | 1,260 | 0.12 | 4.0 | 1.19 | |||
| 2025–2026 H1 | 2025 – 1-е полугодие 2026 | 1,660 | 0.14 | 4.7 | 1.38 | ||
| Full sample | Вся выборка | 8,400 | 0.14 | 4.6 | 1.44 |
6 Backtest design & the cost model
6 Дизайн бэктеста и модель издержек
The book is a decile long-short — D10-long / D1-short, dollar-neutral, next-day horizon — rebalanced as new calls arrive.
Портфель — децильный лонг-шорт — D10-лонг / D1-шорт, долларово-нейтральный, с горизонтом следующего дня — ребалансируется по мере поступления новых звонков.
6.1 Turnover
6.1 Оборачиваемость
The signal refreshes at each call rather than on a calendar, so turnover is driven by earnings-season clustering. Annualized two-sided turnover runs roughly 9×, which is what the cost model is applied against.
Сигнал обновляется на каждом звонке, а не по календарю, поэтому оборачиваемость обусловлена кластеризацией сезона отчётности. Годовая двусторонняя оборачиваемость составляет примерно 9×, именно к ней применяется модель издержек.
6.2 Cost model
6.2 Модель издержек
We charge 2.5 bps per side — half-spread plus a market-impact term plus commission — for 5 bps round-trip. Against a 7.0 bps gross spread, costs consume about 2.4 bps, leaving 4.6 bps net. Reporting only net is the point of the exercise; a gross-only spread is not a strategy.
Мы начисляем 2,5 б.п. на сторону — половина спреда плюс член рыночного воздействия плюс комиссия — что даёт 5 б.п. на полный оборот. Против валового спреда в 7,0 б.п. издержки забирают около 2,4 б.п., оставляя 4,6 б.п. нетто. Отчитываться только нетто — в этом и суть упражнения; чисто валовый спред — это не стратегия.
6.3 Cost sensitivity & capacity
6.3 Чувствительность к издержкам и ёмкость
Net spread falls roughly linearly in assumed cost per side, reaching breakeven at ≈ 7.4 bps/side — about three times the realized cost (Table 4). The edge is real but small, so capacity is bounded by market impact and by the position limits a book of this Sharpe would run, not by the availability of names.
Чистый спред падает примерно линейно с предполагаемой издержкой на сторону, достигая безубыточности при ≈ 7,4 б.п./сторону — примерно втрое больше фактической издержки (Таблица 4). Преимущество реально, но мало, поэтому ёмкость ограничена рыночным воздействием и лимитами позиций, с которыми работал бы портфель такого Sharpe, а не доступностью бумаг.
| Cost / side (bps) | Издержка / сторону (б.п.) | Round-trip (bps) | Полный оборот (б.п.) | Net spread (bps/day) | Чистый спред (б.п./день) | Net ann. return | Чистая годовая доходность | Net Sharpe |
|---|---|---|---|---|---|---|---|---|
| 0.0 (gross) | 0,0 (валовый) | 0 | 7.0 | 17.6% | 2.10 | |||
| 1.0 | 2 | 6.05 | 15.2% | 1.86 | ||||
| 2.5 (realized) | 2,5 (фактически) | 5 | 4.6 | 11.6% | 1.44 | |||
| 4.0 | 8 | 3.2 | 8.1% | 1.00 | ||||
| 6.0 | 12 | 1.3 | 3.3% | 0.41 | ||||
| 7.4 (breakeven) | 7,4 (безубыточность) | 14.8 | 0.0 | 0.0% | 0.00 |
7 Results & robustness
7 Результаты и устойчивость
Net risk statistics against buy-and-hold are in Table 5: the long-short book returns 11.6% annualized at 8.0% volatility for a Sharpe of 1.44, versus 8.4% / 15.6% / 0.54 for buy-and-hold, and it draws down 8.1% against 24.3%. Its market beta is 0.05 and its correlation to buy-and-hold is 0.08 — the return is a genuine overlay, not repackaged market exposure. The sector cut (Fig. 07) is positive in all eight GICS sectors, strongest in Tech and Consumer Discretionary, weakest in rate- and commodity-driven names.
Чистая статистика риска против «купи и держи» приведена в Таблице 5: лонг-шорт-портфель приносит 11,6% годовых при волатильности 8,0% и Sharpe 1,44, против 8,4% / 15,6% / 0,54 у «купи и держи», и его просадка составляет 8,1% против 24,3%. Его рыночная бета равна 0,05, а корреляция с «купи и держи» — 0,08: доходность — это подлинная надстройка, а не переупакованная рыночная экспозиция. Разрез по секторам (Рис. 07) положителен во всех восьми секторах GICS, сильнее всего в технологиях и потребительском необязательном спросе, слабее всего в бумагах, зависящих от ставок и сырья.
7.1 Factor-neutralization note
7.1 Замечание о нейтрализации факторов
The spread survives neutralizing the signal to size, value and momentum; residual IC is about 0.11, so the tone signal is not a style factor wearing a language-model costume.
Спред переживает нейтрализацию сигнала по размеру, стоимости и моментуму; остаточный IC составляет около 0,11, поэтому сигнал тональности — это не стилевой фактор, переодетый в костюм языковой модели.
| Metric | Метрика | Long-short (net) | Лонг-шорт (нетто) | Buy-and-hold | Купи и держи |
|---|---|---|---|---|---|
| Annualized return | Годовая доходность | 11.6% | 8.4% | ||
| Annualized volatility | Годовая волатильность | 8.0% | 15.6% | ||
| Sharpe (rf = 0) | Sharpe (rf = 0) | 1.44 | 0.54 | ||
| Maximum drawdown | Максимальная просадка | −8.1% | −24.3% | ||
| Monthly hit rate | Доля прибыльных месяцев | 63% | 58% | ||
| Market beta | Рыночная бета | 0.05 | 1.00 | ||
| Correlation to B&H | Корреляция с «купи и держи» | 0.08 | 1.00 | ||
| Annualized turnover | Годовая оборачиваемость | ~9× | ~0.3× |
8 Limitations
8 Ограничения
A 0.14 IC is honest, not a bug — it is the expected magnitude for a soft-information overlay on liquid US equities, and anything much larger would invite suspicion of leakage. The edge is capacity-constrained: market impact and position limits cap deployable capital. The classifier carries overfitting risk, mitigated here by out-of-sample grading and subperiod stability but never eliminated. Transcript point-in-time timing depends on vendor timestamps being accurate. The signal decays fast — the edge is concentrated in the first one to two days and is essentially gone by day five, which is what forces the next-day horizon and the turnover it implies. Finally, transcript-vendor coverage gaps on small caps thin the universe in the early years.
IC в 0,14 честен, а не является багом — это ожидаемая величина для надстройки на мягкой информации по ликвидным акциям США, и что-то намного большее вызвало бы подозрение в утечке. Преимущество ограничено по ёмкости: рыночное воздействие и лимиты позиций ограничивают развёртываемый капитал. Классификатор несёт риск переобучения, смягчённый здесь оценкой на отложенной выборке и стабильностью по подпериодам, но никогда не устранённый полностью. Тайминг транскриптов на момент времени зависит от точности меток времени поставщика. Сигнал быстро затухает — преимущество сосредоточено в первые один-два дня и по существу исчезает к пятому дню, что и вынуждает горизонт следующего дня и вытекающую из него оборачиваемость. Наконец, пробелы в охвате у поставщиков транскриптов по компаниям малой капитализации прореживают вселенную в ранние годы.
9 Conclusion
9 Заключение
The result is a small, persistent, cost-surviving edge sourced from language — positive in every subperiod and every sector, uncorrelated with the market, and modest enough to be believable. That is exactly the profile a disciplined book and a set of position limits are built to harvest, and the modesty is the finding, not the disappointment.
Результат — небольшое, устойчивое, переживающее издержки преимущество, извлечённое из языка — положительное в каждом подпериоде и каждом секторе, некоррелированное с рынком и достаточно скромное, чтобы в него можно было поверить. Это именно тот профиль, для сбора которого создаются дисциплинированный портфель и набор лимитов позиций, и скромность — это находка, а не разочарование.
- Loughran, T. & McDonald, B. When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. Journal of Finance, 2011.
- Mayew, W. & Venkatachalam, M. The Power of Voice: Managerial Affective States and Future Firm Performance. Journal of Finance, 2012.
- Frankel, R., Jennings, J. & Lee, J. Disclosure Sentiment: Machine Learning vs. Dictionary Methods. Management Science, 2022.
- Grinold, R. & Kahn, R. Active Portfolio Management, 2nd ed. McGraw-Hill, 2000.
- Kolanovic, M. & Krishnamachari, R. Big Data and AI Strategies: Machine Learning and Alternative Data. Quantitative research note, 2017.
- Loughran-McDonald Master Dictionary, 2024 release.
- Loughran, T. & McDonald, B. When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. Journal of Finance, 2011.
- Mayew, W. & Venkatachalam, M. The Power of Voice: Managerial Affective States and Future Firm Performance. Journal of Finance, 2012.
- Frankel, R., Jennings, J. & Lee, J. Disclosure Sentiment: Machine Learning vs. Dictionary Methods. Management Science, 2022.
- Grinold, R. & Kahn, R. Active Portfolio Management, 2-е изд. McGraw-Hill, 2000.
- Kolanovic, M. & Krishnamachari, R. Big Data and AI Strategies: Machine Learning and Alternative Data. Заметка по количественным исследованиям, 2017.
- Loughran-McDonald Master Dictionary, выпуск 2024.