← INDEX / PROJECTS← ИНДЕКС / ПРОЕКТЫ

PRJ-005 · NLP

PRJ-005 · NLP

Earnings-Call
Sentiment Index

Индекс тональности
отчётных звонков

Executives reveal more in the Q&A than in the script — in what they say, and in what they dodge. This pipeline scores 8,400 calls for tone, hedging and evasion, then asks the only question that matters: is it tradable after costs?

Руководители раскрывают больше в Q&A, чем в подготовленном тексте — и в том, что говорят, и в том, от чего уходят. Этот конвейер оценивает 8 400 звонков по тональности, хеджированию и уклончивости, а затем задаёт единственный важный вопрос: торгуемо ли это после издержек?

Role
Роль
Design & build
Проектирование и разработка
Stack
Стек
Python · NLP · Backtesting
Python · NLP · бэктестинг
Scope
Охват
200 tickers · 7 yrs
200 тикеров · 7 лет
Status
Статус
Research build
Исследовательская версия

// 01 — the problem

// 01 — проблема

Prepared remarks are lawyered, rehearsed and priced in before the call ends. The information lives in the Q&A: how often management hedges — "roughly", "we believe", "too early to say" — and how often they answer a different question than the one asked. An analyst hears that shift on one call. Nobody hears it across 200 tickers, quarter after quarter, for seven years.

And a tone score alone is a language-model demo, not a strategy. The question a PM actually asks is: "Fine, the tone shifted — is it tradable after costs?" That is a backtest, not a vibe.

So the bar is deliberately high. A signal has to survive being z-scored against each company's own history (so it measures change in tone, not which sectors sound nervous), survive an out-of-sample decile sort, and survive a transaction-cost model that eats a third of the raw spread. A small edge that clears all three is worth more than a large one that clears none.

Подготовленные заявления выверены юристами, отрепетированы и учтены в цене ещё до окончания звонка. Информация живёт в Q&A: как часто менеджмент хеджирует — «примерно», «мы полагаем», «пока рано говорить» — и как часто отвечает не на тот вопрос, который был задан. Аналитик слышит этот сдвиг на одном звонке. Никто не слышит его по 200 тикерам, квартал за кварталом, на протяжении семи лет.

А оценка тональности сама по себе — это демонстрация языковой модели, а не стратегия. Вопрос, который на самом деле задаёт портфельный управляющий: «Хорошо, тональность изменилась — торгуемо ли это после издержек?» Это бэктест, а не ощущение.

Поэтому планка намеренно высока. Сигнал должен пережить z-нормализацию относительно собственной истории каждой компании (чтобы он измерял изменение тональности, а не то, какие сектора звучат нервно), пережить сортировку по децилям на отложенной выборке и пережить модель транзакционных издержек, которая съедает треть валового спреда. Небольшое преимущество, прошедшее все три проверки, ценнее большого, не прошедшего ни одной.

// 02 — the approach

// 02 — подход

$Parse 8,400 transcripts; split prepared remarks from Q&A — score the answers, not the script
$Score each answer on hedging / uncertainty / evasion lexicons + a finetuned classifier
$Fuse lexicon and classifier into one tone score; z-score per ticker against its own history
$Sort names into deciles; run a D10-long / D1-short backtest, next-day horizon
$Charge 2.5 bps/side, measure turnover, and report everything net — Sharpe, drawdown, capacity
$Разобрать 8 400 транскриптов; отделить подготовленные заявления от Q&A — оценивать ответы, а не сценарий
$Оценить каждый ответ по лексиконам хеджирования / неопределённости / уклончивости + дообученным классификатором
$Слить лексикон и классификатор в единую оценку тональности; z-нормализация по тикеру относительно его истории
$Разбить бумаги на децили; запустить бэктест D10-лонг / D1-шорт с горизонтом на следующий день
$Начислить 2,5 б.п./сторону, измерить оборачиваемость и отчитаться обо всём нетто — Sharpe, просадка, ёмкость

// 03 — the signal

// 03 — сигнал

Before any backtest, two questions: does the tone index actually track forward returns, and does a decile sort on it produce a clean gradient? Both hold — the co-movement is loose but real, and the sort is nearly monotone. The ablation then shows where the lift comes from: mostly the classifier, with the lexicons adding interpretability and a last edge.

Перед любым бэктестом — два вопроса: действительно ли индекс тональности отслеживает будущую доходность и даёт ли сортировка по децилям чистый градиент? Оба ответа положительны — со-движение слабое, но реальное, а сортировка почти монотонна. Затем абляция показывает, откуда берётся прирост: в основном от классификатора, а лексиконы добавляют интерпретируемость и последнее преимущество.

FIG 01 — SENTIMENT INDEX VS NEXT-DAY RETURNРИС. 01 — ИНДЕКС ТОНАЛЬНОСТИ ПРОТИВ ДОХОДНОСТИ СЛЕДУЮЩЕГО ДНЯ aggregate index vs equal-weight next-day return · monthly · both indexed to 100агрегированный индекс против равновзвешенной доходности следующего дня · помесячно · оба приведены к 100

The two lines move together but not in lockstep — co-movement is the signal, the gaps are where it pays.

Две линии движутся вместе, но не синхронно — со-движение и есть сигнал, а расхождения — там, где оно приносит доход.

SENTIMENT INDEXИНДЕКС ТОНАЛЬНОСТИ NEXT-DAY RETURN, INDEXEDДОХОДНОСТЬ СЛЕД. ДНЯ, ПРИВЕДЕНА
FIG 04 — ROLLING 6-MONTH RANK ICРИС. 04 — СКОЛЬЗЯЩИЙ 6-МЕСЯЧНЫЙ РАНГОВЫЙ IC event-level Spearman IC, trailing 6-month window · next-day horizonранговый IC Спирмена на уровне событий, скользящее 6-месячное окно · горизонт следующего дня

Positive in every window and dips only in the 2020 vol shock — the edge is small but persistent.

Положителен в каждом окне и проседает лишь в шоке волатильности 2020 года — преимущество небольшое, но устойчивое.

ROLLING RANK ICСКОЛЬЗЯЩИЙ РАНГОВЫЙ IC POOLED MEAN 0.14ОБЪЕДИНЁННОЕ СРЕДНЕЕ 0.14
FIG 02 — NEXT-DAY RETURN BY SENTIMENT DECILEРИС. 02 — ДОХОДНОСТЬ СЛЕД. ДНЯ ПО ДЕЦИЛЯМ ТОНАЛЬНОСТИ average gross next-day return per decile, basis points · out-of-sampleсредняя валовая доходность следующего дня по децилям, базисные пункты · отложенная выборка

Almost monotone bottom to top — a real sort, D10 minus D1 is 7.0 bps gross.

Почти монотонно снизу вверх — настоящая сортировка, D10 минус D1 равно 7,0 б.п. валовыми.

FIG 05 — ABLATION: LEXICON vs CLASSIFIER vs COMBINEDРИС. 05 — АБЛЯЦИЯ: ЛЕКСИКОН ПРОТИВ КЛАССИФИКАТОРА ПРОТИВ КОМБИНАЦИИ net decile spread, bps/day · rank IC annotated above each barчистый децильный спред, б.п./день · ранговый IC подписан над каждым столбцом

The classifier does most of the work; the lexicons add interpretability and a last +0.8 bps.

Классификатор делает основную работу; лексиконы добавляют интерпретируемость и последние +0,8 б.п.

// 04 — does it trade?

// 04 — торгуется ли это?

A gradient is not a P&L. The long-short book goes D10-long / D1-short, dollar-neutral, next-day horizon, and every number below is net of a 2.5 bps-per-side cost model that takes about a third of the raw spread. The equity curve clears buy-and-hold with a fraction of the drawdown; the cost sweep shows how much room is left; the sector cut shows the edge is positive everywhere and strongest where narrative drives price.

Градиент — это не P&L. Лонг-шорт-портфель строится как D10-лонг / D1-шорт, долларово-нейтральный, с горизонтом следующего дня, и каждое число ниже приведено нетто, за вычетом модели издержек в 2,5 б.п. на сторону, которая забирает около трети валового спреда. Кривая капитала обходит стратегию «купи и держи» при доле просадки; развёртка по издержкам показывает, сколько запаса осталось; разрез по секторам показывает, что преимущество положительно везде и наиболее сильно там, где цену движет нарратив.

FIG 03 — LONG-SHORT EQUITY CURVE, NET OF COSTSРИС. 03 — КРИВАЯ КАПИТАЛА ЛОНГ-ШОРТ, НЕТТО ИЗДЕРЖЕК D10 long / D1 short vs buy-and-hold · both indexed to 100 · Jul 19–Jun 26D10 лонг / D1 шорт против «купи и держи» · оба приведены к 100 · июль 19 – июнь 26

L/S ends ~+105% with a shallow drawdown; buy-and-hold gets there rougher and gives most of it back twice.

Лонг-шорт заканчивает на ~+105% с неглубокой просадкой; «купи и держи» приходит туда грубее и дважды отдаёт бóльшую часть.

LONG-SHORT, NET OF COSTSЛОНГ-ШОРТ, НЕТТО ИЗДЕРЖЕК BUY-AND-HOLDКУПИ И ДЕРЖИ
FIG 06 — COST-SENSITIVITY SWEEPРИС. 06 — РАЗВЁРТКА ЧУВСТВИТЕЛЬНОСТИ К ИЗДЕРЖКАМ net spread vs assumed cost per side · gross intercept 7.0 bps · breakeven ≈ 7.4 bps/sideчистый спред против предполагаемой издержки на сторону · валовое пересечение 7,0 б.п. · безубыточность ≈ 7,4 б.п./сторону

We clear costs with room to spare — the edge only dies past ~7 bps a side, roughly 3× what we pay.

Мы покрываем издержки с запасом — преимущество исчезает лишь за ~7 б.п. на сторону, примерно втрое больше того, что платим.

NET DECILE SPREADЧИСТЫЙ ДЕЦИЛЬНЫЙ СПРЕД REALIZED 2.5 bps/sideФАКТИЧЕСКИ 2,5 б.п./сторону
FIG 07 — NET SPREAD BY SECTORРИС. 07 — ЧИСТЫЙ СПРЕД ПО СЕКТОРАМ net decile spread by GICS sector, bps/day · out-of-sampleчистый децильный спред по секторам GICS, б.п./день · отложенная выборка

Strongest where narrative drives price — Tech and Consumer — weakest in rate/commodity names. Positive everywhere.

Сильнее всего там, где цену движет нарратив — технологии и потребительский сектор — слабее всего в бумагах, зависящих от ставок и сырья. Положительно везде.

NET DECILE SPREADЧИСТЫЙ ДЕЦИЛЬНЫЙ СПРЕД UNIVERSE AVG 4.6СРЕДНЕЕ ПО ВСЕЛЕННОЙ 4.6

// 05 — by the numbers

// 05 — в цифрах

0
Transcripts scored
Оценено транскриптов
0
Rank IC, next-day
Ранговый IC, след. день
0
Tickers covered
Охвачено тикеров
0 bps
Net decile spread / day
Чистый децильный спред / день
0
Net long-short Sharpe
Чистый Sharpe лонг-шорт
0%
L/S max drawdown
Макс. просадка лонг-шорт

The decile spread runs 7.0 bps a day gross and rises almost monotonically; costs take roughly a third of it, and the net long-short curve still clears buy-and-hold with a fraction of the drawdown — Sharpe 1.44 vs 0.54, an 8% max drawdown against 24%. An IC of 0.14 is modest — the signal is real, small, and honest about being small — which is exactly the kind position limits are built for.

Децильный спред составляет 7,0 б.п. в день валовыми и растёт почти монотонно; издержки забирают около трети, а чистая кривая лонг-шорт всё равно обходит «купи и держи» при доле просадки — Sharpe 1,44 против 0,54, макс. просадка 8% против 24%. IC в 0,14 скромен — сигнал реален, мал и честен в своей малости — а это именно то, для чего создаются лимиты позиций.

// 06 — working note

// 06 — рабочая записка

Scoring Evasion: A Tradable Sentiment Signal from Earnings-Call Q&A

Оценка уклончивости: торгуемый сигнал тональности из Q&A отчётных звонков

AbstractАннотация

We score the Q&A portion of 8,400 earnings calls across 200 US tickers (Jul 2019–Jun 2026) for hedging, uncertainty and evasion, fusing three lexicons with a finetuned transformer classifier and z-scoring each company against its own history. The resulting tone signal has a pooled next-day rank IC of 0.14 and sorts a decile long-short book with a 7.0 bps/day gross spread. After a 2.5 bps-per-side cost model that consumes about a third of the raw edge, the net strategy returns 11.6% annualized at a Sharpe of 1.44 and an 8.1% maximum drawdown, against 8.4% / 0.54 / 24.3% for buy-and-hold. The edge is small, persistent across every subperiod and sector, and — being small — capacity-constrained by design; we treat that honesty as the result, not a caveat.

Мы оцениваем часть Q&A 8 400 отчётных звонков по 200 американским тикерам (июль 2019 – июнь 2026) на хеджирование, неопределённость и уклончивость, объединяя три лексикона с дообученным трансформерным классификатором и z-нормализуя каждую компанию относительно её собственной истории. Итоговый сигнал тональности имеет объединённый ранговый IC следующего дня 0,14 и сортирует децильный лонг-шорт-портфель с валовым спредом 7,0 б.п./день. После модели издержек в 2,5 б.п. на сторону, забирающей около трети сырого преимущества, чистая стратегия приносит 11,6% годовых при Sharpe 1,44 и максимальной просадке 8,1%, против 8,4% / 0,54 / 24,3% у «купи и держи». Преимущество невелико, устойчиво в каждом подпериоде и секторе и — будучи малым — ограничено по ёмкости по своей природе; мы считаем эту честность результатом, а не оговоркой.

1 Introduction

1 Введение

The wager behind this work is narrow and testable: the unscripted portion of an earnings call — the analyst Q&A — is where information leaks, because it is the one segment management cannot fully rehearse. A tone score built on that segment is easy; a tone score that survives being turned into positions is not. We insist on three hurdles before calling anything a signal. First, the raw tone score is z-scored against each ticker's own history, so it captures a change in a management team's posture rather than the fact that some sectors simply sound more cautious than others. Second, the signal is graded out-of-sample via a decile sort, never on the window used to build it. Third, it must clear a transaction-cost model that removes roughly a third of the raw spread. A tone score is a demonstration; a cost-surviving backtest is a result.

Ставка этой работы узка и проверяема: неподготовленная часть отчётного звонка — Q&A с аналитиками — это место, где утекает информация, потому что это единственный сегмент, который менеджмент не может полностью отрепетировать. Оценку тональности по этому сегменту построить легко; оценку тональности, которая переживает превращение в позиции — нет. Мы настаиваем на трёх барьерах, прежде чем называть что-либо сигналом. Во-первых, сырая оценка тональности z-нормализуется относительно собственной истории каждого тикера, чтобы улавливать изменение позиции команды менеджмента, а не тот факт, что некоторые сектора просто звучат осторожнее других. Во-вторых, сигнал оценивается на отложенной выборке через сортировку по децилям, никогда — на окне, использованном для его построения. В-третьих, он должен пройти модель транзакционных издержек, которая убирает примерно треть сырого спреда. Оценка тональности — это демонстрация; бэктест, переживший издержки, — это результат.

2 Data — the transcript panel

2 Данные — панель транскриптов

The panel is 8,400 Q&A sessions across 200 US tickers over seven years (Jul 2019–Jun 2026), an unbalanced panel averaging roughly 1,200 scored calls per year as the covered universe grows from about 150 to 200 names. Coverage widens over time as transcript-vendor availability improves for smaller caps; we do not backfill names into periods where their transcripts were not available point-in-time.

Панель — это 8 400 сессий Q&A по 200 американским тикерам за семь лет (июль 2019 – июнь 2026), несбалансированная панель со средним около 1 200 оценённых звонков в год по мере роста охваченной вселенной примерно со 150 до 200 бумаг. Охват расширяется со временем по мере улучшения доступности транскриптов у поставщиков для компаний малой капитализации; мы не задним числом вносим бумаги в периоды, где их транскрипты не были доступны на момент времени.

2.1 Point-in-time timing
2.1 Тайминг на момент времени

Every transcript carries a close timestamp, and the tone signal is treated as known only after the call closes. Returns are measured next-day open-to-close, so there is no look-ahead from same-session prices bleeding into the score. This is the single most common way a text signal flatters itself, and the timing rule is enforced at the event level.

Каждый транскрипт несёт метку времени закрытия, и сигнал тональности считается известным только после завершения звонка. Доходность измеряется на следующий день от открытия до закрытия, поэтому нет заглядывания вперёд из-за просачивания цен той же сессии в оценку. Это самый распространённый способ, которым текстовый сигнал себе льстит, и правило тайминга применяется на уровне события.

2.2 The prepared / Q&A split
2.2 Разделение подготовленной части и Q&A

A rule-based section splitter isolates the analyst-question and management-answer turns from the prepared-remarks block. Only answers are scored. Prepared remarks are dropped entirely: they are lawyered, disclosed on a schedule and largely priced before the call ends.

Разделитель на основе правил вычленяет реплики вопросов аналитиков и ответов менеджмента из блока подготовленных заявлений. Оцениваются только ответы. Подготовленные заявления полностью отбрасываются: они выверены юристами, раскрываются по расписанию и в основном учтены в цене ещё до окончания звонка.

3 Linguistic construction

3 Лингвистическая конструкция

3.1 The lexicons
3.1 Лексиконы

Three lexicons run over each answer span: a hedging list ("roughly", "we believe", "too early to say"), an uncertainty list of Loughran-McDonald-style modal and uncertain terms, and an evasion measure built from topical divergence between the question and the answer — the degree to which management answers a different question than the one asked.

По каждому фрагменту ответа проходят три лексикона: список хеджирования («примерно», «мы полагаем», «пока рано говорить»), список неопределённости из модальных и неопределённых терминов в стиле Лафрана-Макдональда, и мера уклончивости, построенная на тематическом расхождении между вопросом и ответом — степень, в которой менеджмент отвечает на другой вопрос, а не на заданный.

3.2 The finetuned classifier
3.2 Дообученный классификатор

A small transformer is finetuned on approximately 4,000 hand-labeled answer spans graded on an evasive-to-forthcoming axis. It supplies a continuous tone score per answer that captures phrasing the fixed lexicons miss.

Небольшой трансформер дообучается примерно на 4 000 размеченных вручную фрагментах ответов, оценённых по оси от уклончивости к открытости. Он выдаёт непрерывную оценку тональности по каждому ответу, улавливая формулировки, которые пропускают фиксированные лексиконы.

3.3 Fusion and per-ticker z-scoring
3.3 Слияние и z-нормализация по тикеру

Lexicon and classifier scores are combined into a single call-level tone score, then z-scored against each ticker's own trailing history. This strips persistent cross-company tone bias: a chronically cautious CFO is not a permanent short, and a structurally upbeat management team is not a permanent long. The signal measures change relative to a company's own baseline.

Оценки лексикона и классификатора объединяются в единую оценку тональности на уровне звонка, а затем z-нормализуются относительно собственной предыдущей истории каждого тикера. Это устраняет устойчивое межкорпоративное смещение тональности: хронически осторожный финансовый директор — не вечный шорт, а структурно оптимистичная команда менеджмента — не вечный лонг. Сигнал измеряет изменение относительно собственной базовой линии компании.

4 Signal construction & ablation

4 Построение сигнала и абляция

To locate the source of the lift, we grade three configurations — lexicon-only, classifier-only, and the combined score — on rank IC, gross and net decile spread, and net Sharpe. The verdict in Table 1 is unambiguous: the classifier carries most of the signal, and the lexicons add interpretability plus a marginal +0.8 bps of net spread on top of the classifier alone.

Чтобы найти источник прироста, мы оцениваем три конфигурации — только лексикон, только классификатор и комбинированную оценку — по ранговому IC, валовому и чистому децильному спреду и чистому Sharpe. Вердикт в Таблице 1 однозначен: классификатор несёт бóльшую часть сигнала, а лексиконы добавляют интерпретируемость плюс маргинальные +0,8 б.п. чистого спреда поверх одного классификатора.

TABLE 1 — Ablation: lexicon vs classifier vs combinedТАБЛИЦА 1 — Абляция: лексикон против классификатора против комбинации
ConfigurationКонфигурацияRank ICGross spread (bps/day)Валовый спред (б.п./день)Net spread (bps/day)Чистый спред (б.п./день)Net Sharpe
Lexicon-onlyТолько лексикон0.084.12.30.71
Classifier-onlyТолько классификатор0.126.03.81.18
CombinedКомбинация0.147.04.61.44

5 Signal quality

5 Качество сигнала

The pooled next-day rank IC is 0.14. On a trailing 6-month window it is positive in every window across the seven years and dips below trend only during the 2020 volatility shock, when the cross-sectional dispersion of tone briefly stopped mapping to returns. The per-decile response is near-monotone from D1 to D10, with mean signal rising from −1.55z to +1.58z and gross next-day return from 0.6 to 7.6 bps (Table 2). Subperiod stability is reported in Table 3.

Объединённый ранговый IC следующего дня равен 0,14. На скользящем 6-месячном окне он положителен в каждом окне на протяжении семи лет и опускается ниже тренда лишь во время шока волатильности 2020 года, когда поперечная дисперсия тональности на короткое время перестала отображаться в доходности. Отклик по децилям почти монотонен от D1 к D10, при этом средний сигнал растёт с −1,55z до +1,58z, а валовая доходность следующего дня — с 0,6 до 7,6 б.п. (Таблица 2). Стабильность по подпериодам приведена в Таблице 3.

TABLE 2 — Per-decile next-day statistics (out-of-sample, n=8,400)ТАБЛИЦА 2 — Статистика следующего дня по децилям (отложенная выборка, n=8 400)
DecileДецильnMean signal (z)Средний сигнал (z)Gross next-day (bps)Валовая след. день (б.п.)t-statMonthly hit %Попадания в месяц, %
D1840−1.550.60.548.7
D2840−1.001.41.149.6
D3840−0.661.91.650.3
D4840−0.382.62.251.0
D5840−0.133.42.951.8
D68400.124.03.352.4
D78400.374.93.953.1
D88400.655.74.353.7
D98401.016.94.654.2
D108401.587.64.854.6
D10−D17.0
TABLE 3 — Rank IC and net performance by subperiodТАБЛИЦА 3 — Ранговый IC и чистая результативность по подпериодам
PeriodПериодCallsЗвонкиRank ICNet spread (bps/day)Чистый спред (б.п./день)Net Sharpe
2019 H2–20202-е полугодие 2019 – 20201,8500.113.91.02
20211,1800.175.81.71
20221,2100.155.11.49
20231,2400.134.41.31
20241,2600.124.01.19
2025–2026 H12025 – 1-е полугодие 20261,6600.144.71.38
Full sampleВся выборка8,4000.144.61.44

6 Backtest design & the cost model

6 Дизайн бэктеста и модель издержек

The book is a decile long-short — D10-long / D1-short, dollar-neutral, next-day horizon — rebalanced as new calls arrive.

Портфель — децильный лонг-шорт — D10-лонг / D1-шорт, долларово-нейтральный, с горизонтом следующего дня — ребалансируется по мере поступления новых звонков.

6.1 Turnover
6.1 Оборачиваемость

The signal refreshes at each call rather than on a calendar, so turnover is driven by earnings-season clustering. Annualized two-sided turnover runs roughly , which is what the cost model is applied against.

Сигнал обновляется на каждом звонке, а не по календарю, поэтому оборачиваемость обусловлена кластеризацией сезона отчётности. Годовая двусторонняя оборачиваемость составляет примерно , именно к ней применяется модель издержек.

6.2 Cost model
6.2 Модель издержек

We charge 2.5 bps per side — half-spread plus a market-impact term plus commission — for 5 bps round-trip. Against a 7.0 bps gross spread, costs consume about 2.4 bps, leaving 4.6 bps net. Reporting only net is the point of the exercise; a gross-only spread is not a strategy.

Мы начисляем 2,5 б.п. на сторону — половина спреда плюс член рыночного воздействия плюс комиссия — что даёт 5 б.п. на полный оборот. Против валового спреда в 7,0 б.п. издержки забирают около 2,4 б.п., оставляя 4,6 б.п. нетто. Отчитываться только нетто — в этом и суть упражнения; чисто валовый спред — это не стратегия.

6.3 Cost sensitivity & capacity
6.3 Чувствительность к издержкам и ёмкость

Net spread falls roughly linearly in assumed cost per side, reaching breakeven at ≈ 7.4 bps/side — about three times the realized cost (Table 4). The edge is real but small, so capacity is bounded by market impact and by the position limits a book of this Sharpe would run, not by the availability of names.

Чистый спред падает примерно линейно с предполагаемой издержкой на сторону, достигая безубыточности при ≈ 7,4 б.п./сторону — примерно втрое больше фактической издержки (Таблица 4). Преимущество реально, но мало, поэтому ёмкость ограничена рыночным воздействием и лимитами позиций, с которыми работал бы портфель такого Sharpe, а не доступностью бумаг.

TABLE 4 — Cost sensitivity (net of turnover ~9× annualized)ТАБЛИЦА 4 — Чувствительность к издержкам (нетто при оборачиваемости ~9× годовых)
Cost / side (bps)Издержка / сторону (б.п.)Round-trip (bps)Полный оборот (б.п.)Net spread (bps/day)Чистый спред (б.п./день)Net ann. returnЧистая годовая доходностьNet Sharpe
0.0 (gross)0,0 (валовый)07.017.6%2.10
1.026.0515.2%1.86
2.5 (realized)2,5 (фактически)54.611.6%1.44
4.083.28.1%1.00
6.0121.33.3%0.41
7.4 (breakeven)7,4 (безубыточность)14.80.00.0%0.00

7 Results & robustness

7 Результаты и устойчивость

Net risk statistics against buy-and-hold are in Table 5: the long-short book returns 11.6% annualized at 8.0% volatility for a Sharpe of 1.44, versus 8.4% / 15.6% / 0.54 for buy-and-hold, and it draws down 8.1% against 24.3%. Its market beta is 0.05 and its correlation to buy-and-hold is 0.08 — the return is a genuine overlay, not repackaged market exposure. The sector cut (Fig. 07) is positive in all eight GICS sectors, strongest in Tech and Consumer Discretionary, weakest in rate- and commodity-driven names.

Чистая статистика риска против «купи и держи» приведена в Таблице 5: лонг-шорт-портфель приносит 11,6% годовых при волатильности 8,0% и Sharpe 1,44, против 8,4% / 15,6% / 0,54 у «купи и держи», и его просадка составляет 8,1% против 24,3%. Его рыночная бета равна 0,05, а корреляция с «купи и держи» — 0,08: доходность — это подлинная надстройка, а не переупакованная рыночная экспозиция. Разрез по секторам (Рис. 07) положителен во всех восьми секторах GICS, сильнее всего в технологиях и потребительском необязательном спросе, слабее всего в бумагах, зависящих от ставок и сырья.

7.1 Factor-neutralization note
7.1 Замечание о нейтрализации факторов

The spread survives neutralizing the signal to size, value and momentum; residual IC is about 0.11, so the tone signal is not a style factor wearing a language-model costume.

Спред переживает нейтрализацию сигнала по размеру, стоимости и моментуму; остаточный IC составляет около 0,11, поэтому сигнал тональности — это не стилевой фактор, переодетый в костюм языковой модели.

TABLE 5 — Net risk statistics vs buy-and-hold (Jul 2019–Jun 2026)ТАБЛИЦА 5 — Чистая статистика риска против «купи и держи» (июль 2019 – июнь 2026)
MetricМетрикаLong-short (net)Лонг-шорт (нетто)Buy-and-holdКупи и держи
Annualized returnГодовая доходность11.6%8.4%
Annualized volatilityГодовая волатильность8.0%15.6%
Sharpe (rf = 0)Sharpe (rf = 0)1.440.54
Maximum drawdownМаксимальная просадка−8.1%−24.3%
Monthly hit rateДоля прибыльных месяцев63%58%
Market betaРыночная бета0.051.00
Correlation to B&HКорреляция с «купи и держи»0.081.00
Annualized turnoverГодовая оборачиваемость~9×~0.3×

8 Limitations

8 Ограничения

A 0.14 IC is honest, not a bug — it is the expected magnitude for a soft-information overlay on liquid US equities, and anything much larger would invite suspicion of leakage. The edge is capacity-constrained: market impact and position limits cap deployable capital. The classifier carries overfitting risk, mitigated here by out-of-sample grading and subperiod stability but never eliminated. Transcript point-in-time timing depends on vendor timestamps being accurate. The signal decays fast — the edge is concentrated in the first one to two days and is essentially gone by day five, which is what forces the next-day horizon and the turnover it implies. Finally, transcript-vendor coverage gaps on small caps thin the universe in the early years.

IC в 0,14 честен, а не является багом — это ожидаемая величина для надстройки на мягкой информации по ликвидным акциям США, и что-то намного большее вызвало бы подозрение в утечке. Преимущество ограничено по ёмкости: рыночное воздействие и лимиты позиций ограничивают развёртываемый капитал. Классификатор несёт риск переобучения, смягчённый здесь оценкой на отложенной выборке и стабильностью по подпериодам, но никогда не устранённый полностью. Тайминг транскриптов на момент времени зависит от точности меток времени поставщика. Сигнал быстро затухает — преимущество сосредоточено в первые один-два дня и по существу исчезает к пятому дню, что и вынуждает горизонт следующего дня и вытекающую из него оборачиваемость. Наконец, пробелы в охвате у поставщиков транскриптов по компаниям малой капитализации прореживают вселенную в ранние годы.

9 Conclusion

9 Заключение

The result is a small, persistent, cost-surviving edge sourced from language — positive in every subperiod and every sector, uncorrelated with the market, and modest enough to be believable. That is exactly the profile a disciplined book and a set of position limits are built to harvest, and the modesty is the finding, not the disappointment.

Результат — небольшое, устойчивое, переживающее издержки преимущество, извлечённое из языка — положительное в каждом подпериоде и каждом секторе, некоррелированное с рынком и достаточно скромное, чтобы в него можно было поверить. Это именно тот профиль, для сбора которого создаются дисциплинированный портфель и набор лимитов позиций, и скромность — это находка, а не разочарование.

  1. Loughran, T. & McDonald, B. When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. Journal of Finance, 2011.
  2. Mayew, W. & Venkatachalam, M. The Power of Voice: Managerial Affective States and Future Firm Performance. Journal of Finance, 2012.
  3. Frankel, R., Jennings, J. & Lee, J. Disclosure Sentiment: Machine Learning vs. Dictionary Methods. Management Science, 2022.
  4. Grinold, R. & Kahn, R. Active Portfolio Management, 2nd ed. McGraw-Hill, 2000.
  5. Kolanovic, M. & Krishnamachari, R. Big Data and AI Strategies: Machine Learning and Alternative Data. Quantitative research note, 2017.
  6. Loughran-McDonald Master Dictionary, 2024 release.
  1. Loughran, T. & McDonald, B. When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks. Journal of Finance, 2011.
  2. Mayew, W. & Venkatachalam, M. The Power of Voice: Managerial Affective States and Future Firm Performance. Journal of Finance, 2012.
  3. Frankel, R., Jennings, J. & Lee, J. Disclosure Sentiment: Machine Learning vs. Dictionary Methods. Management Science, 2022.
  4. Grinold, R. & Kahn, R. Active Portfolio Management, 2-е изд. McGraw-Hill, 2000.
  5. Kolanovic, M. & Krishnamachari, R. Big Data and AI Strategies: Machine Learning and Alternative Data. Заметка по количественным исследованиям, 2017.
  6. Loughran-McDonald Master Dictionary, выпуск 2024.

// 07 — the honest read

// 07 — честный вывод

The signal is small, persistent and cheap enough to trade — 0.14 IC, 4.6 bps net a day, Sharpe 1.44 — and it never pretends to be more than that. A soft-information overlay that survives per-ticker z-scoring, an out-of-sample sort, and a cost model taking a third of the raw edge is worth more than a flashier number that clears none of the three.

Сигнал мал, устойчив и достаточно дёшев для торговли — IC 0,14, 4,6 б.п. нетто в день, Sharpe 1,44 — и никогда не притворяется большим, чем есть. Надстройка на мягкой информации, которая переживает z-нормализацию по тикеру, сортировку на отложенной выборке и модель издержек, забирающую треть сырого преимущества, стоит больше, чем более эффектное число, не прошедшее ни одной из трёх проверок.

← PREV / PRJ-004← НАЗАД / PRJ-004LP Reporting AutopilotАвтопилот отчётности для LP